中文

视觉与语言模型中短语定位与任务性能的联合研究

计算与语言 2024-06-03 v3 计算机视觉与模式识别

摘要

在视觉语境中需要对自然语言进行推理的任务,其关键在于将单词和短语定位到图像区域。然而,在当代模型中观察这种定位是复杂的,尽管人们通常预期只要任务以有利于泛化的方式被解决,这种定位就会发生。我们提出了一个联合研究任务性能与短语定位的框架,并提出了三个基准来研究二者之间的关系。我们的结果表明,当代模型在定位短语与解决任务的能力之间存在不一致性。我们展示了如何通过对短语定位标注进行暴力训练来解决这一问题,并分析了由此产生的动态过程。代码与数据见 https://github.com/lil-lab/phrase_grounding。

关键词

引用

@article{arxiv.2309.02691,
  title  = {A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models},
  author = {Noriyuki Kojima and Hadar Averbuch-Elor and Yoav Artzi},
  journal= {arXiv preprint arXiv:2309.02691},
  year   = {2024}
}

备注

This was published in TMLR in 2024, on January 24th