中文

明确或回答:基于强化学习的上下文欠规格 VQA 代理

计算与语言 2026-01-26 v1

摘要

现实世界的视觉问答 (VQA) 常依赖上下文:图像-问题对可能欠规格,使得正确答案依赖于不可在图像中观察到的外部信息。此时,直接回答会导致自信但错误的预测。我们提出 CoA (Clarify-or-Answer),一个问答代理,分别建模是否需要澄清以及若需澄清需问什么。CoA 首先判断是否需要澄清;若是,则提出一个聚焦问题,然后整合响应生成最终答案。我们引入 CONTEXTCLARIFY,包含一组模糊 VQA 问题及其对照集(非模糊)。我们进一步引入 GRPO-CR (Clarification Reasoning),一种强化学习方法,通过多个奖励信号优化澄清问题生成,鼓励生成语法正确、聚焦、非平凡且能消除歧义的问题。在三个 VLLMs 和三个数据集上,CoA 在模块和系统层面均实现一致提升,将端到端 VQA 准确率平均提高 15.3 分(提升 83%),显著优于基于提示的基线方法。

关键词

引用

@article{arxiv.2601.16400,
  title  = {Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification},
  author = {Zongwan Cao and Bingbing Wen and Lucy Lu Wang},
  journal= {arXiv preprint arXiv:2601.16400},
  year   = {2026}
}