中文

从表征到推理:面向视频问答的证据与常识推理

计算机视觉与模式识别 2022-05-31 v1 计算与语言 多媒体

摘要

视频理解在表征学习方面已取得巨大成功,如视频字幕、视频对象定位以及视频描述性问答。然而,当前方法在视频推理(包括证据推理和常识推理)上仍举步维艰。为促进面向视频推理的更深层次视频理解,我们提出了Causal-VidQA任务,其包含从场景描述(描述)到证据推理(解释)和常识推理(预测与反事实)的四类问题。对于常识推理,我们设立了一个两步解决方案:回答问题并提供恰当理由。通过对现有VideoQA方法的广泛实验,我们发现最先进的方法在描述上强而在推理上弱。我们希望Causal-VidQA能引导视频理解研究从表征学习走向更深推理。数据集及相关资源可在\url{https://github.com/bcmi/Causal-VidQA.git}获取。

关键词

引用

@article{arxiv.2205.14895,
  title  = {From Representation to Reasoning: Towards both Evidence and Commonsense Reasoning for Video Question-Answering},
  author = {Jiangtong Li and Li Niu and Liqing Zhang},
  journal= {arXiv preprint arXiv:2205.14895},
  year   = {2022}
}

备注

To appear in CVPR 2022