Лучшие магистерские диссертации выпускников программы «Глубокое обучение и генеративный ИИ»
Лучшие магистерские диссертации выпускников программы
«Глубокое обучение и генеративный ИИ»
В этом году максимальные оценки комиссии получили работы четырех выпускников программы. Рассказываем вам об ИИ-агенте для переговоров, новой модели генерации текста, алгоритме автоматического расширения нейронных сетей и библиотеке для автоматического распознавания действий человека в кадре.
  • Максим Панчук
    Старший ML Engineer в Diasoft
Адаптивный переговорный агент с активным моделированием пространства принятия предложений

Я разработал ИИ-агент, который ведет переговоры и старается извлечь максимум выгоды для своей стороны. Главная сложность в том, что обычно во время диалога истинные приоритеты партнера скрыты: выверенные формулировки и тактичные слова  не выдают, что для него действительно важно. Мой агент, GENEGO, восстанавливает эти приоритеты прямо по ходу переговоров, ориентируясь на поведение, а не на слова. Работает все таким образом: LLM-судья сравнивает пары возможных предложений, а статистическая модель Брэдли-Терри превращает эти сравнения в оценку того, что и насколько важно второй стороне. Опираясь на эту картину, агент уступает в мелочах и настаивает на критических моментах. Чем точнее он угадывает приоритеты, тем больше ценности забирает.

У моего решения есть несколько преимуществ по сравнению с уже существующими на рынке:
1. Точность: агент явно моделирует предпочтения оппонента и не противоречит себе, извлекая примерно на 15% больше ценности.
2. Честная уверенность: система сообщает, насколько ей можно доверять, и ведет себя осторожнее при нехватке данных.
3. Доступность: ИИ-агент не требует обучения на данных конкретной области, новую сделку достаточно описать обычным текстом.

GENEGO можно применять везде, где стороны договариваются об условиях: закупки, контракты, распределение ресурсов, маркетплейсы. Агент может быть полезен и в повседневной жизни, потому что подсказывает, что важно второй стороне, и предлагает разумные компромиссы. 

Работа принята на постерную сессию международной конференции ICML 2026 в Сеуле, одну из ведущих в машинном обучении. Я планирую и дальше развивать это исследование.


  • Алексей Гаврилов
    ML инженер в ИТМО
Разработка модели генерации текста на основе метода латентной дискретной диффузии

Наиболее распространенные методы генерации текста создают его последовательно. Такой подход имеет как плюсы, так и минусы. С одной стороны, последовательная генерация позволяет получить качественный результат, но с другой, работает достаточно медленно и не дает возможности исправить текст, который был сгенерирован раньше.

Альтернативным подходом являются диффузионные модели, которые активно применяются для создания картинок. В частности, латентные диффузионные модели позволяют генерировать высококачественные изображения достаточно быстро для тех размеров, на которых они работают. Сейчас стали развиваться и диффузионные модели для генерации текста, но они либо работают на всей длине генерируемого текста, что долго, либо в латентном пространстве вещественных значений, не очень подходящем для слов (они являются категориальными типами). Моя работа посвящена построению латентной симплексной диффузии, которая работает в дискретном латентном пространстве.

Главное преимущество моей модели — вычислительная эффективность: она генерирует текст в 5.5 раз быстрее, чем авторегрессионные модели, и в 69 раз быстрее, чем диффузионные модели, работающие в пространстве токенов. Кроме ускорения генерации, мое решение потребляет значительно меньше памяти: 8 ГБ у разработанного подхода против 139 ГБ у альтернативных подходов. Из недостатков стоит отметить, что модель пока обладает умеренно сниженными показателями качества относительно авторегрессионного подхода.

Мою модель можно применить везде, где требуется быстрая или хорошо управляемая генерация. Сейчас мы использовали ее для создания текста и кода, но потенциально решение будет работать и с другими дискретными последовательностями, например, в биоинформатике.

По результатам исследования уже было опубликовано несколько статей. В частности, работа по проблеме локализации деградации качества в подходе с дискретной латентной генерацией, а также работа, показывающая перспективы способа управления генерацией на уровне дискретных латентных представлений в коде. В дальнейшем я собираюсь масштабировать подход на бóльшую длину генерации, разные домены применения, улучшение качества и вычислительной эффективности.
  • Евгений Бессоницын
    Старший исследователь в лаборатории «Мультиагентный интеллект и адаптивные системы» ИТМО и AIRI, преподаватель AI360 по машинному обучению
Разработка алгоритма автоматического расширения нейронных сетей

В рамках ВКР я занимался задачей автоматического подбора и улучшения архитектур нейронных сетей. Обычно такие методы требуют больших вычислительных ресурсов: нужно перебрать много вариантов архитектур, обучить промежуточные модели или использовать сложные схемы поиска. Это делает классический нейроархитектурный поиск дорогим и не всегда удобным для практического применения.

Я разработал метод SSONN (Self-Scaled Optimized Neural Network), который подходит к задаче проще. Вместо того, чтобы искать новую архитектуру с нуля, SSONN смотрит на уже существующую сеть, анализирует градиенты внутри модели и определяет, в каких местах ей не хватает выразительной способности. Если на некоторых связях сети градиенты ведут себя нестабильно, то есть этой части модели нужна дополнительная емкость, в такие места SSONN добавляет небольшие новые нейронные структуры.

Таким образом, главное преимущество SSONN — снижение вычислительной стоимости по сравнению с классическими NAS-методами. Вместо глобального поиска по большому пространству архитектур, метод выполняет локальное расширение уже имеющейся сети. Это делает подход более простым, быстрым и доступным для сценариев, где нет возможности запускать длительный NAS-поиск на большом количестве GPU. В отличие от методов, которые изменяют внутренние размерности backbone-архитектуры, SSONN может работать как легкий адаптер: исходная модель сохраняется, а дополнительная емкость добавляется контролируемо. Это упрощает сравнение моделей по числу параметров и времени обучения, а также делает мой метод удобным для практического улучшения уже существующих архитектур.

Эксперименты показали, что SSONN способен улучшать качество фиксированных backbone-моделей и уже найденных NAS-архитектур. Например, мы получили хорошие результаты при расширении ResNeXt-50 и других SOTA архитектур на CIFAR-10 и CIFAR-100. Также SSONN показывает заметное улучшение DARTS и PC-DARTS архитектур в коротком post-search adaptation режиме.

Результаты работы могут применяться в задачах, где требуется быстро улучшить нейронную сеть без дорогостоящего поиска новой архитектуры. Это особенно актуально для компьютерного зрения, классификации изображений, обучения моделей под ограниченный вычислительный бюджет, а также для сценариев, где уже существует хорошая backbone-модель, но требуется повысить ее точность без полного переобучения или нового NAS-поиска.
Статья с результатами исследования была принята на воркшоп A* конференции KDD RelKD. Также я планирую подавать работу на основной трек конференций NIPS и AAAI.
  • Руслан Зарипов
    Стажер Data Scientist в «Сбербанк»
Разработка открытой библиотеки для анализа действий человека на видео методами компьютерного зрения.

Моя работа посвящена автоматическому распознаванию действий человека в кадре с точной привязкой к месту и моменту времени. Это называется пространственно-временной локализацией действий.

Основная сложность задачи в том, что готовые решения обучены на красивых датасетах из YouTube, а на кадрах с реальных камер видеонаблюдения — где люди мелкие, перекрывают друг друга и стоят под неудобными углами — они работают плохо. Чтобы это исправить, я разработал конвейер из пяти этапов: 
  1. детекция людей, 
  2. оценка позы (построение скелета), 
  3. трекинг между кадрами, 
  4. классификация действия,
  5. постобработка. 
Все модули работают параллельно, что позволяет использовать систему в реальном времени. Помимо этого, я предложил два авторских метода: MaskPose — модификация модели оценки позы, которая использует маску силуэта человека, чтобы не путать части тел разных людей, и VisionPose — двухпоточная модель, которая одновременно смотрит и на видеокадр, и на скелет, объединяя оба источника информации. Подходящих открытых датасетов для нужных задач практически нет, поэтому мне пришлось снять собственный: 72 видео у стен университета ИТМО с людьми, которые курят, разговаривают по телефону, едят и пьют. Весь код опубликован в открытом доступе.

У моего решения два главных конкурента: библиотеки MMAction2 и PyTorchVideo. Обе давно не поддерживаются (последние обновления были в 2021—2023 годах), плохо работают в многолюдных сценах и требуют серьезной настройки под новое железо.

Моя система отличается по нескольким параметрам. Во-первых, она изначально заточена под видеонаблюдение, а не под YouTube-клипы — модели дообучены на соответствующих данных. Во-вторых, архитектура конвейера с очередями FIFO позволяет запускать все параллельно и получать результат в реальном времени. В-третьих, разработанная мультимодальная модель VisionPose даёт top-5 accuracy 72% и работает со скоростью 10−15 FPS. Наконец, весь код открыт, что делает решение бесплатным и воспроизводимым.

Самое очевидное применение разработанной библиотеки — промышленная безопасность: система может автоматически замечать нарушения на производстве, например курение в запрещенных зонах или отсутствие защитного снаряжения. Это снижает нагрузку на операторов видеонаблюдения и уменьшает человеческий фактор.

Также ее можно использовать в любых системы общественной безопасности: на вокзалах, в торговы центрах, университетских кампусах. Система способна отслеживать подозрительное поведение или помогать в экстренных ситуациях. В перспективе подобные инструменты могут применяться в здравоохранении (например, для мониторинга пациентов или пожилых людей) и в спортивной аналитике.

По результатам работы уже опубликована статья «Efficient Transformer-Based Spatio-Temporal Action Recognition for Industrial Safety Surveillance» в материалах международной конференции VISAPP 2026. Также я представлял результаты на демо-дне «Сбера» «Идея в действии» в июне 2025 года и на LIV Научной конференции ИТМО в январе 2025 года. Дополнительно получено свидетельство о государственной регистрации программы для ЭВМ № 2 026 617 594.