ETTRL:通过熵机制在 LLM 测试时强化学习中平衡探索与开发
机器学习
2025-09-01 v2 人工智能
摘要
近期大型语言模型的快速发展在复杂推理任务(如数学和编程)中取得了显著进展,但这些模型仍严重依赖标注数据,在无监督情境下适应性有限。为解决这些限制,提出了测试时强化学习(TTRL),通过利用模型生成的伪标签实现自我优化。尽管其前景广阔,但 TTRL 面临若干关键挑战,包括因并行 rollout 而导致的高推理成本,以及早期估计偏差导致的自信度过高,降低输出多样性并引发性能平台期。为解决这些挑战,我们引入熵机制,通过两种策略增强测试时强化学习中的探索-开发平衡:熵-分叉树多数 rollout(ETMR)和熵基优势重塑(EAR)。与基线方法相比,我们的方法使 Llama3.1-8B 在 AIME 2024 基准测试的 Pass at 1 指标上实现了 68% 的相对提升,同时仅使用 60% 的 rollout token 预算。这凸显了本方法在推理效率、多样性和估计鲁棒性之间有效优化权衡的能力,从而推动了开放域推理任务中无监督强化学习的发展。
引用
@article{arxiv.2508.11356,
title = {ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism},
author = {Jia Liu and ChangYi He and YingQiao Lin and MingMin Yang and FeiYang Shen and ShaoGuo Liu},
journal= {arXiv preprint arXiv:2508.11356},
year = {2025}
}