中文

基于表示的探索策略:从测试时到后训练

机器学习 2025-10-14 v1 人工智能

摘要

强化学习(RL)虽然承诺能拓展语言模型的能力,但目前的RL技术是否促进了新行为的发现,抑或仅仅锐化了基础模型中已有的行为,尚不明了。本文我们考察了以明确激励模型发现新型且多样化行为的主动探索价值,并旨在理解预训练模型中的知识如何指导这一搜索。我们的主要发现表明,采用源自预训练语言模型隐藏状态的简单且原则驱动的基于表示的探索奖励,能显著提升探索的多样性和 pass@k 指标——无论是用于后训练,还是我们引入的一种新型推理时扩展设置中。对于推理时,基于表示的探索能提升效率,始终在各种模型和推理任务中改善 pass@k 指标。例如,针对 Qwen-2.5-14b-Instruct,我们在几乎所有任务中实现了超过 50% 的验证器效率提升。对于后训练,我们表明将该探索策略集成到RL流水线中,可提升相较于初始模型和标准RL后训练的推理性能。例如,在AIME 2024上,我们经过后训练的 Qwen-2.5-7b-Instruct 的 pass@80 可与GRPO在同一模型上的 pass@256 相当,实现了 3 倍的测试时样本效率提升。总体而言,我们的发现表明,采用恰当的多样性概念进行主动探索,是实现超越锐化、发现新行为的实用路径。

关键词

引用

@article{arxiv.2510.11686,
  title  = {Representation-Based Exploration for Language Models: From Test-Time to Post-Training},
  author = {Jens Tuyls and Dylan J. Foster and Akshay Krishnamurthy and Jordan T. Ash},
  journal= {arXiv preprint arXiv:2510.11686},
  year   = {2025}
}

备注

Website and code: https://rep-exp.github.io