中文

VisualCOMET:对静态图像动态上下文的推理

计算机视觉与模式识别 2020-08-04 v3 计算与语言

摘要

即使仅从静态图像的一帧,人们也能推理出该图像在帧前、帧后及帧外之外的动态故事。例如,给定一张男子在水中挣扎求生的图像,我们可以推理出该男子在过去某个时刻落入水中,其当下的意图是活下去,并且他在不久的将来需要帮助否则会被冲走。我们提出 VisualComet,一种用于预测可能发生过的事件、可能接下来发生的事件以及人物当下意图的视觉常识推理任务新框架。为支持视觉常识推理研究,我们引入了首个大规模视觉常识图仓库,包含超过 140 万条在 60,000 张多样化图像上仔细标注的视觉常识推理文本描述,每张图像均配有前因与后果的短视频摘要。此外,我们提供了图像中出现的人物与文本常识描述中提到的人物之间的个体对应(即共指链接),从而实现图像与文本间更紧密的集成。我们在此任务上建立了强劲的基线性能,并证明视觉与文本常识推理之间的集成是关键,且优于非集成方案。

关键词

引用

@article{arxiv.2004.10796,
  title  = {VisualCOMET: Reasoning about the Dynamic Context of a Still Image},
  author = {Jae Sung Park and Chandra Bhagavatula and Roozbeh Mottaghi and Ali Farhadi and Yejin Choi},
  journal= {arXiv preprint arXiv:2004.10796},
  year   = {2020}
}

备注

Project Page: http://visualcomet.xyz (ECCV 2020 Spotlight)