Mismatch Quest:面向图文错配的视觉与文本反馈
计算与语言
2024-07-18 v2 计算机视觉与模式识别
摘要
尽管现有的图文对齐模型能够实现高质量的二元评估,但它们无法精确定位错配的确切来源。本文提出一种方法,对检测到的图文对之间的错配提供详细的文本和视觉解释。我们利用大语言模型和视觉定位模型自动构建训练集,该训练集针对给定图像包含看似合理但错配的描述,以及相应的文本解释和视觉指示。我们还发布了一个新的人工标注测试集,包含真值文本和视觉错配标注。实验结果表明,在我们的训练集上微调视觉语言模型,使其能够清晰表述错配并在图像中进行视觉指示,在二元对齐分类和解释生成任务上均优于强基线。我们的方法代码和人工标注测试集可在以下网址获取:https://mismatch-quest.github.io/
引用
@article{arxiv.2312.03766,
title = {Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment},
author = {Brian Gordon and Yonatan Bitton and Yonatan Shafir and Roopal Garg and Xi Chen and Dani Lischinski and Daniel Cohen-Or and Idan Szpektor},
journal= {arXiv preprint arXiv:2312.03766},
year = {2024}
}