中文

在测试时强化学习中检测和缓解多数投票导致的正确答案灭绝窗口

机器学习 2026-05-28 v2 人工智能

摘要

测试时强化学习(TTRL)报告称,通过使用多数投票作为伪标签信号,在数学推理基准测试中获得了显著的准确率提升。我们认为这些提升被系统性地误解了:大多数提升反映的是对已可解问题的锐化,而非真正的学习,而问题从正确被破坏为错误的数量超过了真正学习到的数量,并且一旦多数投票锁定了一个错误答案,这种损害是不可逆的。逐问题跟踪揭示,低能力问题中的正确答案信号在短暂活跃后会被永久抑制,我们将此现象称为“正确答案灭绝窗口”,并将翻转率(FR)作为其领先指标。因此,我们提出了TTRL-Guard,一个轻量级框架,包含三种针对灭绝窗口的机制:翻转率感知奖励缩放(FRS)在FR下降时降低高风险更新的权重,少数保留采样(MPS)保留来自少数正确答案的梯度信号,以及风险条件稀疏更新(RCSU)暂停对极化问题的更新。在三个模型和四个基准测试上的实验表明,TTRL-Guard在Qwen2.5-7B-Instruct和Qwen3-4B上取得了最佳的平均pass@1,并在AIME 2025上相对于TTRL相对提升了+54%。

关键词

引用

@article{arxiv.2605.19444,
  title  = {Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting},
  author = {Hongxiang Lin and Zhirui Kuai and Erpeng Xue and Lei Wang},
  journal= {arXiv preprint arXiv:2605.19444},
  year   = {2026}
}