Контекстно-орієнтована генерація описів відео з використанням  VideoBERT та доменно-орієнтовних адаптерів

Main Article Content

Машталір Сергій Володимирович
Новічонок Марія Сергіївна

Анотація

Актуальність. Автоматизований опис відео є актуальним завданням для реінжинірингу робочих процесів та бізнес аналізу, проте його ефективність у реальних умовах залежить від доменного зсуву між навчальними наборами даних і  середовищами практичного застосування. Мета. Метою дослідження є розроблення архітектури контекстно-орієнтованої  генерації описів відео, що поєднує попередньо навчені відеопредставлення з легковаговими механізмами адаптації. Методи. Запропонований підхід інтегрує заморожений 12-шаровий енкодер VideoBERT із двогілковим адаптаційним модулем  доменно-орієнтовних адаптерів та тришаровим авторегресійним Трансформер-декодером. Візуальні ознаки виділяються за  допомогою моделі ResNet-50, попередньо навченої на наборі даних ImageNet. Гілки доменно-інваріантних адаптерів та  доменно-специфічних адаптерів паралельно обробляють контекстуалізовані представлення та об’єднуються за допомогою  навчуваного скалярного коефіцієнта злиття. Під час навчання застосовується стратегія стохастичного маскування 50%  токенів на основі моделювання маскованої мови. Результати. Оцінювання на наборі даних Something-Something V2  показало, що повна конфігурація VideoBERT, доменно-орієнтовних адаптерів та Трансформер-декодера з 50 %  моделюванням маскованої мови досягає середнього значення BLEU-4 0,1469, ROUGE-L 0,3474 та METEOR 0,2720.  Покомпонентне абляційне дослідження демонструє покращення завдяки як двогілковому адаптаційному модулю, так і  регуляризації моделювання маскованої мови. Висновки. Запропонована архітектура забезпечує модульний та параметрично  ефективний підхід до контекстно-орієнтованої генерації описів відео, тоді як явне оцінювання міждоменного перенесення  залишається напрямом подальших досліджень.

Downloads

Download data is not yet available.

Article Details

Розділ

Інформатика та інтелектуальні інформаційні технології

Біографії авторів

автор Машталір Сергій Володимирович, афіліація Харківський національний університет радіоелектроніки, пр. Науки 14. Харків, 61166, Україна

доктор технічних наук, професор кафедри Інформатики 

Scopus Author ID: 36183980100

автор Новічонок Марія Сергіївна, афіліація Харківський національний університет  радіоелектроніки, пр. Науки 14.Харків, 61166, Україна

аспірантка кафедри Інформатики 

Як цитувати

Контекстно-орієнтована генерація описів відео з використанням  VideoBERT та доменно-орієнтовних адаптерів. (2026). Інформатика. Культура. Техніка, 3(1 (3), 221–235. https://doi.org/10.15276/ict.03.2026.19

Посилання

Статті цього автора (цих авторів), які найбільше читають