PDCR:面向视觉语言推理的感知分解置信奖励
计算与语言
2026-05-14 v1
摘要
基于可验证奖励的强化学习(RLVR)传统上依赖稀疏的、基于结果的信号。近期研究表明,提供细粒度的、模型内在的信号(对ground-truth答案置信度增长进行奖励)能够有效改进语言推理训练,提供无需高成本外部模型的逐步级指导。虽然对单模态文本有效,但我们发现,将这种全局奖励直接应用于视觉语言(V-L)推理是次优策略,因为该任务是稀疏视觉感知与稠密文本推理的混合体。这种全局归一化会导致混合性信号失真,其中视觉步骤的训练信号被主要文本步骤的统计分布所扭曲。我们提出感知分解置信奖励(PDCR),一种解决这一问题的框架,通过与任务的异构性相匹配奖励结构。PDCR 首先执行无监督技能分解,引入模型内部的视觉依赖得分来量化视觉依赖性,并应用聚类算法将感知步骤与推理步骤分离。基于此,PDCR 按每个技能簇内部归一化置信度增益计算分解后的优势。这种簇内归一化为感知和推理提供稳定、正确比例的信号。我们在关键 V-L 推理基准测试中展示了 PDCR 在超越简单全局奖励形式和稀疏奖励基线方法方面的优势。
引用
@article{arxiv.2605.13467,
title = {PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning},
author = {Hee Suk Yoon and Eunseop Yoon and Ji Woo Hong and SooHwan Eom and Gwanhyeong Koo and Mark Hasegawa-Johnson and Qi Dai and Chong Luo and Chang D. Yoo},
journal= {arXiv preprint arXiv:2605.13467},
year = {2026}
}
备注
CVPR 2026