用于视频字幕生成的协作三流Transformer
计算机视觉与模式识别
2023-09-19 v1
摘要
作为句子中最关键的成分,主语、谓语和宾语在视频字幕生成任务中需要特别关注。为实现这一想法,我们设计了一个新颖的框架,称为协作三流Transformer(COST),以分别建模这三部分并相互补充以获得更好的表示。具体而言,COST由三条Transformer分支组成,以利用视频与文本、检测对象与文本、动作与文本之间在空间-时间域中不同粒度的视觉-语言交互。同时,我们提出一个跨粒度注意力模块来对齐三条Transformer分支建模的交互,进而三条分支可相互支持,利用不同粒度最具判别性的语义信息以准确预测字幕。整个模型以端到端方式训练。在三个大规模具有挑战性的数据集(即YouCookII、ActivityNet Captions和MSVD)上开展的广泛实验表明,所提方法优于当前最先进(state-of-the-art)的方法。
引用
@article{arxiv.2309.09611,
title = {Collaborative Three-Stream Transformers for Video Captioning},
author = {Hao Wang and Libo Zhang and Heng Fan and Tiejian Luo},
journal= {arXiv preprint arXiv:2309.09611},
year = {2023}
}
备注
Accepted by CVIU