中文

重访视觉定位

计算机视觉与模式识别 2019-04-05 v1

摘要

我们重访一种特定的视觉定位方法:Johnson 等人(2015)的“使用场景图的图像检索”(IRSG)系统。我们的实验表明,该系统并未有效利用其学到的对象关系模型。我们还仔细考察了 IRSG 数据集,以及广泛使用的、由其改编的视觉关系数据集(VRD)。我们发现这些数据集存在偏差,使得忽略关系的方法也能相对较好地表现。我们还描述了 IRSG 数据集的其他若干问题,并报告了在该数据集一个去除了偏差与其他问题的子集上的实验。我们的研究有助于一项更普遍的努力:更好地理解结合语言与视觉的机器学习方法实际学到了什么,以及流行数据集实际测试了什么。

关键词

引用

@article{arxiv.1904.02225,
  title  = {Revisiting Visual Grounding},
  author = {Erik Conser and Kennedy Hahn and Chandler M. Watson and Melanie Mitchell},
  journal= {arXiv preprint arXiv:1904.02225},
  year   = {2019}
}

备注

To appear in Proceedings of the Workshop on Shortcomings in Vision and Language, NAACL-2019, ACL