若共识出错?测试时的选择性互补强化学习
机器学习
2026-04-21 v2 人工智能
摘要
测试时强化学习(TTRL)通过从多数投票共识中推导伪奖励,使大型语言模型(LLMs)能够在无标签测试流上增强推理能力。然而,现有的 TTRL 方法仅依赖正向伪标记策略,这使得其在面对答案分布高度分散导致共识微弱的挑战性情景时,容易受到挑战。本文提出了 SCRL(Selective-Complementary Reinforcement Learning),一个稳健的测试时强化学习框架,有效缓解标签噪声的放大。SCRL 发展了选择性正向伪标记,强制执行严格的共识准则以过滤不可靠的多数派。补充地,SCRL 引入了熵门控负向伪标记,这是 TTRL 中首个负向监督机制,用于基于生成不确定性可靠地修剪错误的轨迹。大量实验表明,SCRL 在多个推理基准测试中显著优于基线方法,同时在受限 rollout 预算下保持稳健的泛化和训练稳定性。我们的代码可在 https://github.com/Jasper-Yan/SCRL 上获取。
引用
@article{arxiv.2603.19880,
title = {What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time},
author = {Dong Yan and Jian Liang and Yanbo Wang and Shuo Lu and Ran He and Tieniu Tan},
journal= {arXiv preprint arXiv:2603.19880},
year = {2026}
}
备注
Accepted at ACL 2026 Main Conference