重访视觉定位
计算机视觉与模式识别
2019-04-05 v1
摘要
我们重访一种特定的视觉定位方法:Johnson 等人(2015)的“使用场景图的图像检索”(IRSG)系统。我们的实验表明,该系统并未有效利用其学到的对象关系模型。我们还仔细考察了 IRSG 数据集,以及广泛使用的、由其改编的视觉关系数据集(VRD)。我们发现这些数据集存在偏差,使得忽略关系的方法也能相对较好地表现。我们还描述了 IRSG 数据集的其他若干问题,并报告了在该数据集一个去除了偏差与其他问题的子集上的实验。我们的研究有助于一项更普遍的努力:更好地理解结合语言与视觉的机器学习方法实际学到了什么,以及流行数据集实际测试了什么。
引用
@article{arxiv.1904.02225,
title = {Revisiting Visual Grounding},
author = {Erik Conser and Kennedy Hahn and Chandler M. Watson and Melanie Mitchell},
journal= {arXiv preprint arXiv:1904.02225},
year = {2019}
}
备注
To appear in Proceedings of the Workshop on Shortcomings in Vision and Language, NAACL-2019, ACL