教授视觉语言模型提问:解决视觉问答中的歧义
计算机视觉与模式识别
2025-09-17 v2 计算与语言
摘要
在视觉问答(VQA)语境中,用户由于表达习惯的差异,常对视觉语言模型(VLMs)提出模糊问题。现有研究主要通过重述问题来解决此类歧义,但这些方法忽略了用户与VLMs之间交互的内在特性——通过用户反馈可以澄清歧义。然而,针对交互式澄清的研究面临两个主要挑战:(1)缺乏评估VLMs通过交互解决歧义能力的基准;(2)VLMs被训练成倾向于回答而非提问,从而阻碍其寻求澄清。为克服这些挑战,我们引入了 ClearVQA 基准,该基准针对VQA语境中常见的三类歧义,涵盖各种VQA场景。
引用
@article{arxiv.2507.13773,
title = {Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions},
author = {Pu Jian and Donglei Yu and Wen Yang and Shuo Ren and Jiajun Zhang},
journal= {arXiv preprint arXiv:2507.13773},
year = {2025}
}
备注
ACL2025 Main (SAC Highlight Award)