中文

ETS:基于能量的测试时扩展方法用于无训练强化学习对齐

机器学习 2026-05-20 v3

摘要

强化学习 (RL) 后训练对齐语言模型有效,但在实践中代价高昂且不稳定,由于其复杂的训练过程。为此,我们提出一种无训练的推理方法,直接从最优 RL 策略中进行采样。应用到遮盖语言建模 (MLM) 的转移概率由参考策略模型和能量项组成。基于此,我们的算法能量引导测试时扩展 (ETS),通过在线蒙特卡罗方法估计关键能量项,并具有可证明的收敛速率。此外,为确保实际效率,ETS 利用现代加速框架和量身定制的重要抽样估计器,显著减少推理延迟,同时可证明地保持采样质量。在包括自回归模型和扩散语言模型在内的 MLM 上进行推理、编码和科学基准测试的实验中,我们的 ETS 在生成质量上 consistently 获得改进,验证了其有效性和设计。代码已提供。

关键词

引用

@article{arxiv.2601.21484,
  title  = {ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment},
  author = {Xiuyu Li and Jinkai Zhang and Mingyang Yi and Yu Li and Longqiang Wang and Yue Wang and Ju Fan},
  journal= {arXiv preprint arXiv:2601.21484},
  year   = {2026}
}

备注

Accepted by ICML 2026