视觉与语言模型中短语定位与任务性能的联合研究
计算与语言
2024-06-03 v3 计算机视觉与模式识别
摘要
在视觉语境中需要对自然语言进行推理的任务,其关键在于将单词和短语定位到图像区域。然而,在当代模型中观察这种定位是复杂的,尽管人们通常预期只要任务以有利于泛化的方式被解决,这种定位就会发生。我们提出了一个联合研究任务性能与短语定位的框架,并提出了三个基准来研究二者之间的关系。我们的结果表明,当代模型在定位短语与解决任务的能力之间存在不一致性。我们展示了如何通过对短语定位标注进行暴力训练来解决这一问题,并分析了由此产生的动态过程。代码与数据见 https://github.com/lil-lab/phrase_grounding。
引用
@article{arxiv.2309.02691,
title = {A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models},
author = {Noriyuki Kojima and Hadar Averbuch-Elor and Yoav Artzi},
journal= {arXiv preprint arXiv:2309.02691},
year = {2024}
}
备注
This was published in TMLR in 2024, on January 24th