Разработка открытой библиотеки для анализа действий человека на видео методами компьютерного зрения.Моя работа посвящена автоматическому распознаванию действий человека в кадре с точной привязкой к месту и моменту времени. Это называется пространственно-временной локализацией действий.
Основная сложность задачи в том, что готовые решения обучены на красивых датасетах из YouTube, а на кадрах с реальных камер видеонаблюдения — где люди мелкие, перекрывают друг друга и стоят под неудобными углами — они работают плохо. Чтобы это исправить, я разработал конвейер из пяти этапов:
- детекция людей,
- оценка позы (построение скелета),
- трекинг между кадрами,
- классификация действия,
- постобработка.
Все модули работают параллельно, что позволяет использовать систему в реальном времени. Помимо этого, я предложил два авторских метода: MaskPose — модификация модели оценки позы, которая использует маску силуэта человека, чтобы не путать части тел разных людей, и VisionPose — двухпоточная модель, которая одновременно смотрит и на видеокадр, и на скелет, объединяя оба источника информации. Подходящих открытых датасетов для нужных задач практически нет, поэтому мне пришлось снять собственный: 72 видео у стен университета ИТМО с людьми, которые курят, разговаривают по телефону, едят и пьют. Весь код опубликован в открытом доступе.
У моего решения два главных конкурента: библиотеки MMAction2 и PyTorchVideo. Обе давно не поддерживаются (последние обновления были в 2021—2023 годах), плохо работают в многолюдных сценах и требуют серьезной настройки под новое железо.
Моя система отличается по нескольким параметрам. Во-первых, она изначально заточена под видеонаблюдение, а не под YouTube-клипы — модели дообучены на соответствующих данных. Во-вторых, архитектура конвейера с очередями FIFO позволяет запускать все параллельно и получать результат в реальном времени. В-третьих, разработанная мультимодальная модель VisionPose даёт top-5 accuracy 72% и работает со скоростью 10−15 FPS. Наконец, весь код открыт, что делает решение бесплатным и воспроизводимым.
Самое очевидное применение разработанной библиотеки — промышленная безопасность: система может автоматически замечать нарушения на производстве, например курение в запрещенных зонах или отсутствие защитного снаряжения. Это снижает нагрузку на операторов видеонаблюдения и уменьшает человеческий фактор.
Также ее можно использовать в любых системы общественной безопасности: на вокзалах, в торговы центрах, университетских кампусах. Система способна отслеживать подозрительное поведение или помогать в экстренных ситуациях. В перспективе подобные инструменты могут применяться в здравоохранении (например, для мониторинга пациентов или пожилых людей) и в спортивной аналитике.
По результатам работы уже опубликована статья «
Efficient Transformer-Based Spatio-Temporal Action Recognition for Industrial Safety Surveillance» в материалах международной конференции VISAPP 2026. Также я представлял результаты на демо-дне «Сбера» «Идея в действии» в июне 2025 года и на LIV Научной конференции ИТМО в январе 2025 года. Дополнительно получено свидетельство о государственной регистрации программы для ЭВМ № 2 026 617 594.