利用 wikiHow 的视觉目标-步骤推断
计算机视觉与模式识别
2021-09-13 v2 人工智能
计算与语言
机器学习
多媒体
摘要
理解完成一个目标需要哪些步骤序列,可帮助人工智能系统对人类活动进行推理。过去 NLP 领域的工作已考察了文本的目标-步骤推断任务。我们引入了其视觉对应物。我们提出视觉目标-步骤推断(VGSI)任务,其中模型被给定一个文本目标,且必须从四张图像中选择一张代表朝向该目标的合理步骤。利用从 wikiHow 采集、由 772,277 张表示人类动作的图像组成的新数据集,我们表明该任务对最先进的多模态模型而言具有挑战性。此外,从我们的数据学到的多模态表示可有效迁移到其他数据集如 HowTo100m,将 VGSI 准确率提升 15 - 20%。我们的任务将促进关于程序性事件的多模态推理。
引用
@article{arxiv.2104.05845,
title = {Visual Goal-Step Inference using wikiHow},
author = {Yue Yang and Artemis Panagopoulou and Qing Lyu and Li Zhang and Mark Yatskar and Chris Callison-Burch},
journal= {arXiv preprint arXiv:2104.05845},
year = {2021}
}