— Еще до поступления Сергей предложил мне сначала самому поискать идею для будущего исследования, чтобы заниматься действительно интересным направлением. Если я такую идею не найду, всегда есть готовый список тем по профилю программы. Мне повезло, что в какой-то момент подруга скинула статью по D3PM, с которой она тогда разбиралась. Я почитал, статья показалась мне интересной и перспективной, поэтому я заинтересовался именно текущей областью исследований. Забавно, что через какое-то время подруга перестала заниматься машинным обучением, а я наоборот увлекся ее темой.
Сейчас моя основная область исследований — диффузионные модели для генерации текста и дискретных последовательностей вообще. Мне это интересно, кажется перспективным и важным, поскольку усовершенствование методов позволит ускорить генерацию текстов, кода, биоинформатических последовательностей и, как следствие, ускорит научный и инженерный прогресс.
Например, я сделал прототип по обучению пайплайна из автокодировщика, который сжимает текст в дискретные латенты в четыре раза по длине. Эта модель показала неплохое качество и многократный прирост скорости генерации на небольшом датасете рассказов для детей TinyStories. Теперь ее нужно масштабировать под датасеты реальных задач и под условную генерацию. Пока мне это не удалось сделать, но вышла
промежуточная статья — case study с разбором, где именно происходит узкое горлышко и основная потеря в качестве. Я нашел контринтуитивное место потери качества, что поможет будущим исследователям не тратить лишнее время, пытаясь исправить то, что не является проблемой.
Также в одной из
работ был представлен дополнительный уровень для введения обусловленности на уровне латентов модели, что позволяет переделывать ограниченные участки кода, не ломая и не изменяя при этом остальные строки. Согласно предварительным результатам, это повысит надежность регенерации кода, ограничиваясь только локальными участками, позволит делать это быстрее и качественнее. Это исследование приняли на
The ACM International Conference on the Foundations of Software Engineering (FSE'26), но я, к сожалению, не смог поехать лично из-за сложностей с получением визы в Канаду.
Помимо меня исследованиями текстовых диффузионных моделей в ИТМО занимаются аспирант Алан Газзаев (его
работу мы недавно представляли на воркшопе ICML'26 и сейчас продолжение этого исследования принято на индустриальный трек EMNLP'26) и две студентки теперь уже второго курса бакалавриата ТОП Data Science Анна Дашевская и Яна Зимина. Надеюсь, что в этом учебном году количество заинтересованных в теме студентов будет возрастать, и у нас получится охватить еще больше перспективных задач.
Также я занимаюсь вторым проектом, который появился благодаря лаборатории «Мультиагентный интеллект и адаптивные системы». Это разработка авторецензента статей с помощью LLM и автономного ИИ-исследователя в принципе. По сути мы изучаем возможности ИИ-агентов открывать новые алгоритмы машинного обучения без полноценного участия человека. Авторецензент позволит нам, во-первых, оценивать достоинства и недостатки своих работ перед подачей на конференции, и во-вторых, включить эту оценку в пайплайн автономного ИИ-исследователя. Наша цель, чтобы в будущем ученый мог просто ставить системе задачу, которую она дальше решает самостоятельно.