Контекстно-орієнтована генерація описів відео з використанням VideoBERT та доменно-орієнтовних адаптерів
Main Article Content
Анотація
Актуальність. Автоматизований опис відео є актуальним завданням для реінжинірингу робочих процесів та бізнес аналізу, проте його ефективність у реальних умовах залежить від доменного зсуву між навчальними наборами даних і середовищами практичного застосування. Мета. Метою дослідження є розроблення архітектури контекстно-орієнтованої генерації описів відео, що поєднує попередньо навчені відеопредставлення з легковаговими механізмами адаптації. Методи. Запропонований підхід інтегрує заморожений 12-шаровий енкодер VideoBERT із двогілковим адаптаційним модулем доменно-орієнтовних адаптерів та тришаровим авторегресійним Трансформер-декодером. Візуальні ознаки виділяються за допомогою моделі ResNet-50, попередньо навченої на наборі даних ImageNet. Гілки доменно-інваріантних адаптерів та доменно-специфічних адаптерів паралельно обробляють контекстуалізовані представлення та об’єднуються за допомогою навчуваного скалярного коефіцієнта злиття. Під час навчання застосовується стратегія стохастичного маскування 50% токенів на основі моделювання маскованої мови. Результати. Оцінювання на наборі даних Something-Something V2 показало, що повна конфігурація VideoBERT, доменно-орієнтовних адаптерів та Трансформер-декодера з 50 % моделюванням маскованої мови досягає середнього значення BLEU-4 0,1469, ROUGE-L 0,3474 та METEOR 0,2720. Покомпонентне абляційне дослідження демонструє покращення завдяки як двогілковому адаптаційному модулю, так і регуляризації моделювання маскованої мови. Висновки. Запропонована архітектура забезпечує модульний та параметрично ефективний підхід до контекстно-орієнтованої генерації описів відео, тоді як явне оцінювання міждоменного перенесення залишається напрямом подальших досліджень.

