中文

高效强化学习需要良好的基础模型吗?基础模型在探索中的计算作用

机器学习 2025-03-17 v2 人工智能 计算与语言 统计理论 统计理论

摘要

利用主动探索——即有意识地鼓励模型产生多样化、信息丰富的响应——的语言模型对齐(或强化学习)技术,有望实现超人类能力。然而,目前对具有语言模型的计算高效探索的算法设计原语的理解有限。为了更好地理解如何利用强大的预训练生成模型来提高探索效率,我们引入了一个新的带有语言模型的强化学习计算框架,其中学习者通过采样预言机与模型交互。聚焦于线性 softmax 模型参数化,我们提供了新的结果,揭示了高效探索的计算-统计权衡:1. 覆盖的必要性:覆盖是指预训练模型覆盖近最优响应的程度——一种隐藏知识的形式。我们证明,覆盖虽然不是数据效率所必需的,但为框架中任何算法的运行时间设定了下界。2. 推理时探索:我们引入了一种新算法 SpannerSampling,只要预训练模型具有足够的覆盖,该算法即可获得最优数据效率且计算高效,与我们的下界相匹配。SpannerSampling 利用预训练模型的推理时计算来缩小探索的有效搜索空间。3. 训练时干预的不足:我们通过证明产生适当策略的训练时干预无法在多项式时间内实现类似保证,来与上述结果形成对比。4. 多轮探索的计算益处:最后,我们证明在额外的表示假设下,可以通过多轮探索实现改进的运行时间(用 token 级覆盖替换序列级覆盖)。

关键词

引用

@article{arxiv.2503.07453,
  title  = {Is a Good Foundation Necessary for Efficient Reinforcement Learning? The Computational Role of the Base Model in Exploration},
  author = {Dylan J. Foster and Zakaria Mhammedi and Dhruv Rohatgi},
  journal= {arXiv preprint arXiv:2503.07453},
  year   = {2025}
}

备注

V2: Improved number of prompts used by Algorithm 1