中文

VCap:基于超几何分布奖励的弱到强视觉描述

计算机视觉与模式识别 2026-05-28 v1 人工智能 计算与语言 多媒体

摘要

视觉描述需要模型忠实地捕捉视觉内容,同时最小化遗漏和幻觉。作为描述的主导范式,大型多模态语言模型 (MLLM) 通过规模化和高质量数据实现了强大的性能。最近,强化学习 (RL) 成为驱动 MLLM 向更高精度和更广覆盖率迈进的关键途径,但现有的描述奖励设计未能为事实验证提供细粒度可靠信号,限制了其有效性。为此,我们提出 VCap,将参考描述(见证者)与视觉信号(裁决者)配对。通过在视觉信号基础上明确验证参考描述与策略生成描述之间的事实一致性,VCap 为描述质量验证提供准似超几何分布水平的奖励信号。该设计即使来自不完美的参考也能有效学习,促进 RL 训练中的弱到强泛化。在实验中,使用 VCap 训练的 8B 模型在多个图像和视频描述基准上超越了开源和闭源 SOTA 模型。人类评估进一步确认其强大的事实正确性对齐。此外,VCap 改进了 MLLM 的感知能力,跨任务泛化,并超越最佳 N 蒸馏,挑战了关于 RLVR 的先行假设。

关键词

引用

@article{arxiv.2605.28023,
  title  = {VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning},
  author = {Xingyu Lu and Jinpeng Wang and Yi-Fan Zhang and Yankai Yang and Yancheng Long and Yiyang Fan and Xuanyu Zheng and Haonan Fan and Kaiyu Jiang and Tianke Zhang and Changyi Liu and Bin Wen and Fan Yang and Tingting Gao and Han Li and Chun Yuan},
  journal= {arXiv preprint arXiv:2605.28023},
  year   = {2026}
}

备注

28 pages, 8 figures