从内部开始:基于置信度校准的渐进分布细化
机器学习
2026-03-18 v1 计算与语言
摘要
将模型内部信息作为强化学习(RL)中的自奖励信号受到广泛关注,其标签无关的特性是其主要优势之一。尽管先前的工作在应用测试时扩展(TTS)策略方面取得了显著进展,但测试与训练期间内部信息之间的差异仍未得到充分解决。此外,基于投票策略的测试时训练往往会出现奖励入侵问题。为此,我们提出DistriTTRL,通过模型置信度分布的先验条件,在RL中逐步优化奖励信号,而非仅依赖单次查询 rollout。我们通过多样性目标惩罚缓解基于投票TTS策略导致的持续奖励入侵现象。得益于模型能力与自奖励信号相互补充的训练机制以及奖励入侵的缓解,DistriTTRL在多个模型和基准测试上实现了显著的性能提升。
引用
@article{arxiv.2603.16500,
title = {From the Inside Out: Progressive Distribution Refinement for Confidence Calibration},
author = {Xizhong Yang and Yinan Xia and Huiming Wang and Mofei Song},
journal= {arXiv preprint arXiv:2603.16500},
year = {2026}
}
备注
15 pages