中文

DUEL:基于对抗自我博弈的多模态推理

计算机视觉与模式识别 2026-05-26 v1 计算与语言

摘要

强化学习(RL)已被证明是提高视觉语言模型(VLM)推理能力的有效范式。然而,RL 基于优化通常依赖于难以扩展的高质量标注。现有的无监督替代方案可能因视觉 grounding 较弱且缺乏可靠验证信号而偏向有偏解。我们提出一种自演化后训练框架DUEL,其中监督信号源自两个初始化于相同预训练 VLM 的策略之间的对抗互动。挑战者(Challenger)生成一个基于图像的真实声明,以及经最小扰动的困难负面样本;求解器(Solver)则验证这两个声明是否与图像相符,鼓励在接近邻语义下进行细粒度视觉判别。为稳定优化,我们引入一种长度归一化的对数似然奖励,保留了超越二进制结果监督的有信息优化信号,并在稀疏反馈下提高学习稳定性。实验表明,DUEL 在无需额外人工标注、外部奖励模型或图像编辑工具的情况下,持续改进视觉推理和稳健判别能力。

关键词

引用

@article{arxiv.2605.24794,
  title  = {DUEL: Adversarial Self-Play for Multimodal Reasoning},
  author = {Lin Qiu and Hanqing Zeng and Yao Liu and Bingjun Sun and Guangdeng Liao and Ji Liu},
  journal= {arXiv preprint arXiv:2605.24794},
  year   = {2026}
}