中文

FOIL它!发现图像与语言描述之间的一个不匹配

计算机视觉与模式识别 2017-08-02 v1 计算与语言 多媒体

摘要

本文旨在理解当前的语言与视觉(LaVi)模型是否真正掌握两种模态之间的交互。为此,我们提出MSCOCO数据集的扩展FOIL-COCO,它将图像与正确及“foil”描述相关联,后者与原始描述高度相似但包含一个单一错误(“foil词”)。我们展示当前的LaVi模型落入该数据的陷阱,并在三项任务上表现糟糕:a)描述分类(正确vs. foil);b)foil词检测;c)foil词纠正。相比之下,人类在这些任务上近乎完美。我们证明仅利用语言线索不足以建模FOIL-COCO,且它通过要求对文本与图像之间关系的细粒度理解而对最先进水平提出挑战。

关键词

引用

@article{arxiv.1705.01359,
  title  = {FOIL it! Find One mismatch between Image and Language caption},
  author = {Ravi Shekhar and Sandro Pezzelle and Yauhen Klimovich and Aurelie Herbelot and Moin Nabi and Enver Sangineto and Raffaella Bernardi},
  journal= {arXiv preprint arXiv:1705.01359},
  year   = {2017}
}

备注

To appear at ACL 2017