Стас К.: «Наша повседневная культура существует на уровне скелета»
Иногда кажется, что в датасайенс — науке о данных — сосредоточена вся соль цифровизации. Специалисты этой области знаний разбираются в математике, компьютерных науках, машинном обучении, статистических исследованиях, для того чтобы направлять реку данных в русло решения конкретных задач. Датасайентист Цифрового кластера Станислав К. работает в командах проектов «Предотвращение отказов нефтедобывающего оборудования», «Предиктивная аналитика оборудования сбора и подготовки газа» и «Система для автоматического обучения нейронных сетей в компьютерном зрении». Выпускник МГТУ им. Баумана рассуждает о трендах в искусственном интеллекте, родстве нефтянки и медицины, авторской системе управления проектами, цифровой культуре и Formula 1.
Подробности — в большом интервью еженедельного дайджеста.
— Стас, поговорим об исследовании Gartner «Топ-10 стратегических технологических трендов для 2019 года». Его авторы предположили, что к 2019 году рынок перейдёт от осознания того, что такое искусственный интеллект, к активному внедрению и применению последнего. На дворе уже 2020-й.
Как ты считаешь, сбылся ли прогноз аналитиков?
— Думаю, прогноз сбывается. Сегодня бизнес тестирует data driven подход во многих сферах деятельности, поэтому на рынке появляется больше продуктов, основанных на данных. Кроме того, бизнес уже не готов давать деньги на «задачки в вакууме». Компании приняли за правило проводить что-то вроде опытно-промышленной эксплуатации решений, которая предполагает интеграцию с текущими системами.
— В мире AI, как и в любой прикладной сфере, есть свои тренды. Например, AutoML, трёхмерная детализация, использование специфических метрик для идентификации лиц. Как ты считаешь,
в какой мере Цифровой кластер следует этим трендам?
— Опираясь на опыт команд, в которых работаю, могу сказать, что кластер в большей степени проповедует инженерный подход: в начале проекта команда тестирует прежде всего те решения, которые хорошо показали себя в прошлом и дают ожидаемое качество. Но мы смотрим и в сторону новых методов. Может быть,
они не взлетят, а может, войдут в нашу копилку хороших инженерных решений.
— О каких новых методах идет речь?
— Например, в проектах, связанных с «предиктивкой», мы постоянно пробуем различные архитектуры рекуррентных нейронных сетей. Эти архитектуры хорошо зарекомендовали себя в задачах natural language processing (NLP). Задачи NLP и предиктивной аналитики схожи тем, что в обеих областях работают
с последовательностями.
Что касается компьютерного зрения, это уже достаточно стабильная область. Её новинки можно тестировать
и по ходу проекта. Например, для детектирования разливов мы попробовали нейронную сеть RetinaNet, и в целом это сработало хорошо, теперь она тоже перешла в разряд методов, которые мы используем.
— Отвлечемся ненадолго от Цифрового кластера. Какие тренды AI наиболее близки тебе лично?
— Мне интересно применение компьютерного зрения для анализа последовательности кадров и событий, определения действий, а не просто наличия объекта в кадре. Например, если человек в кадре поднимает пакет, уже не так важно, что это человек и пакет, — интересно само действие. Мне кажется, это самая перспективная область: она мультидисциплинарная и просто так не дастся, но если мы сможем устанавливать логику между объектами, это откроет большой простор для автоматизации.
— Если наложить детектирование процессов на реалии нашей компании, что мы сможем отслеживать? Например, открыл ли рабочий люк цистерны, залил ли в неё топливо?
— Почему бы и нет. Взял ли рабочий какой-то инструмент, как он им пользуется. Последнее — это, конечно, пока совсем фантастика.
— В прошлом году вы успешно перенесли одну из моделей для анализа электросигналов головного мозга на скважину, и это помогло предсказывать остановы глубинно-насосного оборудования. Планируете ли
в этом году что-то такое же грандиозное и необычное?
— В принципе, да. Мы действительно заглядываем во все профессиональные области и не ограничиваемся моделями, которые применяют только в нефтянке. Например, мы рассматривали модель, которую используют
при детектировании поломок авиационных двигателей.
— Насколько я знаю, компания S7 использует предиктивные модели, которые помогают предотвращать поломки самолетов.
— Возможно это та же самая модель, о которой я говорил.
Нас по-прежнему вдохновляют результаты в медицине. Она применяет статистические методы анализа выживаемости, которые дают понять, сколько проживёт человек с тем или иным заболеванием. В анализе выживаемости есть занятные нюансы, и мы планируем опробовать их в следующих цифровых инициативах.
Например, такой анализ предполагает оценку влияния принятых пациентом лекарств. Допустим, у вас есть группа пациентов. Половина просто живёт с определенным заболеванием, а вторая половина больных принимает экспериментальные пилюли. Мы при этом знаем, когда они начали их принимать и когда закончили, можем оценить, какой эффект оказал этот приём.
Та же история — со скважинами. У нас есть скважины, на части которых проводят мероприятия: промывку, химизацию и т.п. Эффект от них может быть положительным, нейтральным или отрицательным. Нужно понять, как выразить этот эффект, посчитать, а потом, если получится, на основе полученной информации спланировать новые мероприятия.
— Медицина и нефтянка дружат.
— У меня есть объяснение этому. В 80−90-х годах прошлого века в стране старались «подружить» статистику
и медицину: пытались предсказать степень тяжести родов у женщин, анализировали кардиограммы и так далее.
В результате медицина стала областью, которая генерирует достаточно много данных. Сегодня мы смотрим
в сторону медицины и задаёмся вопросом: почему бы не провести анализ телеметрии скважин по аналогии
с анализом кардиограмм? И проводим, — к счастью, у всех методов есть независящее от прикладной области математическое ядро.
— Насколько я знаю, дефицит данных — большая проблема для компаний, которые хотят применять искусственный интеллект.
— Наверное, уместнее говорить о проблеме качества данных. Данные плюс — минус есть у всех, и рано
или поздно компании окончательно справятся с этой трудностью, а вот проблема качества данных будет актуальна всегда, потому что нет предела совершенству.
— Самый удачный и полезный, на твой взгляд, случай применения искусственного интеллекта в промышленности.
— Больше всего мне нравятся системы компьютерного зрения в автопилотах автомобилей Tesla. Они не просто накидали кучу алгоритмов, и они как-то работают, — у них идёт проработка на нескольких уровнях.
Во-первых, они сделали собственное железо, адаптированное под быструю работу свёрточных нейросетей.
Во-вторых, у них здорово продумана инфраструктура со сбором данных с машин, дообучением, тестированием различных версий алгоритмов. Владелец машины может не замечать, как обновляется её прошивка, и автопилот становится лучше. У телефонов такое есть, у машин — нет.
В-третьих, они часто экспериментируют и имеют много технологий, которых вообще ни у кого нет.
Их технологическое решение, думаю, одно из немногих, которое почти невозможно скопировать.
— Если помнишь, мы оба ходили на семинар «Просто об искусственном интеллекте» на Дубининской.
Его вел амбассадор компании NVidia Сергей Шатов, который тогда сказал: «Стандартная работа математика — не в конструировании нейросетей, а в адаптации готового эталонного решения
под собственные задачи. 98% датасайентистов берут уже созданные нейросети и подстраивают под свои цели». Прокомментируй, пожалуйста, это высказывание.
— С этим утверждением можно согласиться только отчасти. Предлагаю рассмотреть пример из компьютерного зрения, где такой подход наиболее распространен. В самом простом приближении нейросеть состоит из двух частей — свёрточной и полносвязной. Свёрточная (конволюционная) часть отвечает за извлечение информации
из фотографий, полносвязная — за отнесение этой информации к одному из классов.
Когда мы говорим о том, что используем предобученные сети, мы понимаем, что есть большой датасет, состоящий из сотен тысяч фотографий, на котором обучили сеть (в том числе её сверточную часть). Датасайентист берёт её и учит под свои данные полносвязную часть. То есть у разработчика есть сеть, которая извлекает признаки
из фотографий, но ему нужно адаптировать (обучить) полносвязную часть нейронной сети под свою конкретную задачу. Это просто особенность, которая, я считаю, не должна принижать работу специалистов датасайенс.
— Если не ошибаюсь, ты окончил МГТУ им. Баумана. Какой факультет?
— Да, я окончил МГТУ, получил степень магистра. Учился на кафедре прикладной математики факультета «Фундаментальные науки».
— Что, помимо знаний и навыков, тебе дало образование?
— МГТУ — вуз с очень сильными инженерными корнями, и по нему давно гуляет мем, который недалёк от правды: если тебе нужно смоделировать технический объект, представь его в виде балки. Иными словами, не усложняй и иди от простейших предположений, если же они не дают результата, — усложняй, но делай это постепенно. Естественно, это наложило на меня определённый отпечаток: на практике я сначала применяю простые модели, т.к. они интерпретируемы, легко объясняемы и прогнозируемы.
Учёба в Бауманке дала мне опыт общения как с людьми академического склада, так и с реальными отраслевиками, людьми производства, которые делают чертежи, строят модели для авиационных двигателей. Думаю, что МГТУ — одно из немногих мест, которое предоставляет такую возможность. Впрочем, профессию датасайентиста я освоил не в вузе. По сути, это было самообразование, и так учатся почти все люди нашей специальности.
— В прошлый раз ты говорил о том, что вы отошли от классических подходов эджайла, что у вас союз вольных каменщиков, авторская система управления проектами, которая помогает делать то,
что вы делаете. Как изменилась эта система со временем?
— Мы понемногу усложняем систему: пробуем некоторые штуки из скрама и канбана, оставляя те, которые дают эффект, добавляем совместное планирование задач и формулирование гипотез. Команды работают
по двухнедельным спринтам, и в начале каждого из них мы, наряду с обязательным пулом задач, которые нужны для поддержки текущих решений, рассматриваем задачи от самих разработчиков.
Раньше всё было более спонтанно: в среду человек принёс одну идею, в четверг — другую. Это тоже хорошо,
но сейчас мы больше планируем, обеспечиваем прозрачность для людей, которые по грейдам стоят выше, чем мы.
Ещё одно новшество, которое мы добавили к нашему подходу, — неформальные выступления по пятницам
с презентациями интересных новых идей в ML.
— В кластере много говорят о цифровой культуре, и, на мой взгляд, её главные носители — это вы, «бородатые парни со смузи, которые пилят цифру». Это выражение одного из цифровизаторов СИБУРа. Чем вы живёте? О чём думаете?
— Так просто и не сформулируешь. Наша повседневная культура существует на уровне скелета, спинного мозга. Наверное, об этом лучше спросить у людей, которые с нами работают. Возможно, ответ на этот вопрос дополнит информация обо мне лично.
— Да, расскажи о своих интересах. Наверное, любишь технические новинки?
— Не могу сказать, что меня интересуют все технические новинки, — скорее, только те, с которыми связана моя работа: видеокарты, железо. А такие вещи, как телефон, я покупаю на пятилетку.
Помимо работы я увлекаюсь кольцевыми гонками Formula 1, картингом, автоспортом в целом. Много смотрю
и читаю о нём. Мне нравится, что в автоспорте, в отличие от той же атлетики, пересекаются инженерия и спорт: победа зависит от автомобиля (его построение — нетривиальная задача) и от того, как ты им управляешь. Тандем инженерной мысли и таланта гонщика — это то, что меня привлекает в автоспорте.
Made on
Tilda