中文

iPerceive:将常识推理应用于多模态密集视频描述与视频问答

计算机视觉与模式识别 2020-11-17 v1 人工智能 机器学习 多媒体 图像与视频处理

摘要

多数现有视觉理解研究仅依赖分析“什么”(如事件识别)与“哪里”(如事件定位),这在某些情况下无法正确描述事件间的上下文关系,或导致错误的底层视觉注意力。定义我们人类且与机器根本不同的部分,是我们本能地寻求任何关联背后的因果,例如事件Y作为事件X的直接结果而发生。为此,我们提出iPerceive,一个能够通过利用上下文线索构建常识知识库来推断视频中物体间因果关系,从而理解视频中事件间“为什么”的框架。我们使用密集视频描述(DVC)与视频问答(VideoQA)任务展示了我们技术的有效性。此外,尽管多数DVC与VideoQA的现有工作仅依赖视觉信息,音频与语音等其他模态对人类观察者感知环境也至关重要。我们将DVC与VideoQA任务表述为利用多模态的机器翻译问题。通过在ActivityNet Captions与TVQA数据集上分别评估iPerceive DVC与iPerceive VideoQA,我们表明我们的方法推进了当前最优水平。代码与样本见:iperceive.amanchadha.com。

关键词

引用

@article{arxiv.2011.07735,
  title  = {iPerceive: Applying Common-Sense Reasoning to Multi-Modal Dense Video Captioning and Video Question Answering},
  author = {Aman Chadha and Gurneet Arora and Navpreet Kaloty},
  journal= {arXiv preprint arXiv:2011.07735},
  year   = {2020}
}

备注

13 pages, 6 figures, 4 tables, Project Page: https://iperceive.amanchadha.com