中文

利用 wikiHow 的视觉目标-步骤推断

计算机视觉与模式识别 2021-09-13 v2 人工智能 计算与语言 机器学习 多媒体

摘要

理解完成一个目标需要哪些步骤序列,可帮助人工智能系统对人类活动进行推理。过去 NLP 领域的工作已考察了文本的目标-步骤推断任务。我们引入了其视觉对应物。我们提出视觉目标-步骤推断(VGSI)任务,其中模型被给定一个文本目标,且必须从四张图像中选择一张代表朝向该目标的合理步骤。利用从 wikiHow 采集、由 772,277 张表示人类动作的图像组成的新数据集,我们表明该任务对最先进的多模态模型而言具有挑战性。此外,从我们的数据学到的多模态表示可有效迁移到其他数据集如 HowTo100m,将 VGSI 准确率提升 15 - 20%。我们的任务将促进关于程序性事件的多模态推理。

关键词

引用

@article{arxiv.2104.05845,
  title  = {Visual Goal-Step Inference using wikiHow},
  author = {Yue Yang and Artemis Panagopoulou and Qing Lyu and Li Zhang and Mark Yatskar and Chris Callison-Burch},
  journal= {arXiv preprint arXiv:2104.05845},
  year   = {2021}
}