澄清即为监督:基于强化学习的视觉语言界面
机器学习
2025-10-01 v1 计算与语言
计算机视觉与模式识别
摘要
近期仅基于文本的模型展现了惊人的数学推理能力。将其扩展到视觉领域需要视觉语言模型将图像翻译为文本描述。然而,当前模型训练目标是为人类读者生成标题,往往遗漏推理系统所需的精确细节。这导致界面不匹配:推理系统失败的原因往往并非推理能力有限,而是缺乏关键视觉信息的访问。我们提出了自适应澄清强化学习(AC-RL),通过交互教授视觉模型推理系统所需的关键信息。我们的关键洞察是,训练期间的澄清请求揭示了信息差;通过惩罚需要澄清才能成功的情形,迫使模型生成一次性即可解决问题的全面性标题。AC-RL在七个视觉数学推理基准测试中平均准确率提升4.4分,分析表明若允许澄清请求,可减少最高39%的澄清请求。通过将澄清视为隐式监督,AC-RL表明视觉语言界面可以通过交互式学习,而无需显式标注。
引用
@article{arxiv.2509.26594,
title = {Clarification as Supervision: Reinforcement Learning for Vision-Language Interfaces},
author = {John Gkountouras and Ivan Titov},
journal= {arXiv preprint arXiv:2509.26594},
year = {2025}
}