半参数化视频接地文本生成
计算机视觉与模式识别
2023-01-30 v1 计算与语言
机器学习
摘要
高效的视频-语言建模应考虑计算成本,因为视频帧数量庞大,有时甚至难以处理。参数化方法如注意力机制可能并不理想,因为其计算成本随视频长度增加呈二次增长。相反,以往研究依赖离线特征提取或帧采样来高效表示视频,聚焦于短视频片段中的跨模态建模。本文提出一种半参数化视频接地文本生成模型 SeViT,这是面向长未剪辑视频的可扩展视频-语言建模新视角。将视频视为外部数据存储,SeViT 包含一个非参数帧检索器,根据给定的查询从数据存储中选取若干查询相关帧,以及一个参数化生成器,通过后期融合方法将帧与查询有效聚合。实验结果表明,我们的方法在更长视频与因果视频理解上具有显著优势。此外,我们的模型在四个视频-语言数据集上达到新的 SOTA:iVQA(+4.8)、Next-QA(+6.9)、Activitynet-QA(+4.8)准确率,以及 MSRVTT-Caption(+3.6)CIDEr。
引用
@article{arxiv.2301.11507,
title = {Semi-Parametric Video-Grounded Text Generation},
author = {Sungdong Kim and Jin-Hwa Kim and Jiyoung Lee and Minjoon Seo},
journal= {arXiv preprint arXiv:2301.11507},
year = {2023}
}
备注
Preprint (16 pages, 5 figures)