中文

半参数化视频接地文本生成

计算机视觉与模式识别 2023-01-30 v1 计算与语言 机器学习

摘要

高效的视频-语言建模应考虑计算成本,因为视频帧数量庞大,有时甚至难以处理。参数化方法如注意力机制可能并不理想,因为其计算成本随视频长度增加呈二次增长。相反,以往研究依赖离线特征提取或帧采样来高效表示视频,聚焦于短视频片段中的跨模态建模。本文提出一种半参数化视频接地文本生成模型 SeViT,这是面向长未剪辑视频的可扩展视频-语言建模新视角。将视频视为外部数据存储,SeViT 包含一个非参数帧检索器,根据给定的查询从数据存储中选取若干查询相关帧,以及一个参数化生成器,通过后期融合方法将帧与查询有效聚合。实验结果表明,我们的方法在更长视频与因果视频理解上具有显著优势。此外,我们的模型在四个视频-语言数据集上达到新的 SOTA:iVQA(+4.8)、Next-QA(+6.9)、Activitynet-QA(+4.8)准确率,以及 MSRVTT-Caption(+3.6)CIDEr。

关键词

引用

@article{arxiv.2301.11507,
  title  = {Semi-Parametric Video-Grounded Text Generation},
  author = {Sungdong Kim and Jin-Hwa Kim and Jiyoung Lee and Minjoon Seo},
  journal= {arXiv preprint arXiv:2301.11507},
  year   = {2023}
}

备注

Preprint (16 pages, 5 figures)