面向多句子视频字幕生成的隐式与显式常识
计算机视觉与模式识别
2024-01-10 v2
摘要
现有的稠密或段落视频字幕方法依赖于视频的整体表示,可能结合学习到的物体/动作表示,以条件化分层语言解码器。然而,它们从根本上缺乏推理事件演进、因果关系乃至场景中某些物体功能所需的世界常识知识。为应对这一局限,我们提出一种新颖的基于Transformer的视频字幕模型,该模型同时考虑隐式(视觉-语言与纯语言)和显式(知识库)常识知识。我们表明,这些知识形式无论单独还是组合,均能提升所生成字幕的质量。进一步,受模仿学习启发,我们提出一项新任务——指令生成,其目标是从展示任务执行的视频中产出一组语言指令。我们利用基于AI2-THOR环境生成的ALFRED数据集[54]形式化该任务。尽管指令生成在概念上类似于段落字幕,但其不同之处在于表现出更强的物体持续性,以及空间感知与因果性的句子结构。我们表明,我们的常识知识增强方法在该任务上取得显著提升( METEOR最高提升57%,CIDEr提升8.5%),并在更传统的ActivityNet Captions数据集[29]视频字幕上取得最先进结果。
引用
@article{arxiv.2303.07545,
title = {Implicit and Explicit Commonsense for Multi-sentence Video Captioning},
author = {Shih-Han Chou and James J. Little and Leonid Sigal},
journal= {arXiv preprint arXiv:2303.07545},
year = {2024}
}
备注
The paper is under consideration at Computer Vision and Image Understanding Journal