VLTinT:用于连贯视频段落描述的视觉-语言 Transformer-in-Transformer
计算机视觉与模式识别
2023-02-17 v2
摘要
视频段落描述旨在为具有多个时间事件位置的未剪辑视频生成连贯的多语句描述。遵循人类感知过程,即在视觉与语言的相互影响下,通过将场景分解为视觉(例如人、动物)和非视觉(例如动作、关系)成分来有效理解场景,我们首先提出了一种视觉-语言(VL)特征。在所提出的 VL 特征中,场景由三种模态建模,包括:(i) 全局视觉环境;(ii) 局部视觉主体;(iii) 语言场景元素。然后,我们引入了一种自回归 Transformer-in-Transformer(TinT),以同时捕获视频内事件内和事件间内容的语义连贯性。最后,我们提出了一种新的 VL 对比损失函数,以保证学习到的嵌入特征与描述语义相匹配。在 ActivityNet Captions 和 YouCookII 数据集上的综合实验和广泛消融研究表明,所提出的 Visual-Linguistic Transformer-in-Transformer(VLTinT)在准确性和多样性方面优于先前最先进的方法。源代码已公开于:https://github.com/UARK-AICV/VLTinT。
引用
@article{arxiv.2211.15103,
title = {VLTinT: Visual-Linguistic Transformer-in-Transformer for Coherent Video Paragraph Captioning},
author = {Kashu Yamazaki and Khoa Vo and Sang Truong and Bhiksha Raj and Ngan Le},
journal= {arXiv preprint arXiv:2211.15103},
year = {2023}
}
备注
Accepted to AAAI 2023 Oral