ClaimDiff-RL:通过视觉声明比较实现细粒度图像描述强化学习
机器学习
2026-05-26 v2 人工智能
计算机视觉与模式识别
摘要
长序列图像描述暴露了 RL 中奖励粒度问题:描述被整体序列评估,而重要错误发生在单个视觉声明层面。好的稠密描述应既忠实又信息丰富,既避免幻觉又不遗漏关键细节。然而,两两偏好、参考基于指标和整体标量奖励将这些局部错误压缩为单个序列级信号,掩盖了事实性和覆盖性之间的权衡。我们引入 ClaimDiff-RL,一个使用参考条件原子声明差异作为描述 RL 奖励单元的框架。给定图像、一个演员描述和一个参考描述,一个多模态裁判枚举视觉上依托的差异,验证每个差异是否对应图像,分配开放词汇错误类型和严重程度级别,并为奖励组成生成每个差异的统计数据。这使得幻觉声明和遗漏关键事实分别可测量和可调。实验表明,整体标量奖励可以通过增加遗漏事实来降低幻觉,而 ClaimDiff-RL 揭示了这种忠实性和覆盖性之间的权衡,并实现更平衡的运行点。在一个 160 图像的人类标注诊断基准、公共描述基准和 VQA 基准上,ClaimDiff-RL 改善了幻觉-遗漏事实的平衡,保持了通用能力,并在几个细粒度能力维度上甚至超过 Gemini-3-Pro-Preview,例如对象计数、空间关系和场景识别。这些结果表明,类型化、可验证的声明差异是细粒度和可诊断的描述 RL 的有效奖励单元。
引用
@article{arxiv.2605.20278,
title = {ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison},
author = {Tianle Li and Xuyang Shen and Yan Ma and Rongxin Guo and Shaoxiang Chen and Jiacheng Chen and Haochen Wang and Hongyang Tang and Yucong Zhou and Yu Cheng},
journal= {arXiv preprint arXiv:2605.20278},
year = {2026}
}