中文

谁是 Waldo?跨文本与图像的人物关联

计算机视觉与模式识别 2021-08-18 v2 计算与语言 机器学习

摘要

我们提出一项以人为中心的视觉定位任务及基准数据集,即把标题中提及的人名与图像中呈现的人物进行关联的问题。与先前 predominantly 基于物体的视觉定位工作不同,我们的新任务将标题中的人名掩去,以促使在此类图像-标题对上训练的方法关注上下文线索(如多人之间的丰富交互),而非学习名字与外表的关联。为推进该任务,我们引入一个自动从 Wikimedia Commons 图像-标题数据中挖掘的新数据集 Who's Waldo。我们提出一种基于 Transformer 的方法,在该任务上优于若干强基线,并正将我们的数据发布给研究界以激发对同时考量视觉与语言的上下文模型的工作。

关键词

引用

@article{arxiv.2108.07253,
  title  = {Who's Waldo? Linking People Across Text and Images},
  author = {Claire Yuqing Cui and Apoorv Khandelwal and Yoav Artzi and Noah Snavely and Hadar Averbuch-Elor},
  journal= {arXiv preprint arXiv:2108.07253},
  year   = {2021}
}

备注

Published in ICCV 2021 (Oral). Project webpage: https://whoswaldo.github.io