基于扩展 Best-of-N 采样的推理灵活赋能
机器学习
2026-04-20 v1
摘要
本文提出了一种新方法,在强化学习 (RL) 的推理动作中引入赋能,从而实现探索-利用困境 (EED) 的灵活性。在先前的方法中,用于促进探索的赋能作为内在动机 RL 中任务特定奖励函数的附加项提供。然而,这种方法在考虑到赋能的策略被学习之前会引入延迟,使得难以根据需要调整对探索的侧重。另一方面,为在推理时微调近期基础模型而设计的技巧,即所谓的 best-of-N (BoN) 采样,允许在不显式学习的情况下隐式获取修改后的策略。预期将此技巧应用于促进探索的项(如赋能)将能够更灵活地调整 EED。因此,本文研究了赋能的 BoN 采样。此外,为了以可推广的方式调整策略修改程度同时保持计算成本,本文提出了一种由 Tsallis 统计扩展的新型 BoN 采样方法。通过简单问题,验证了所提方法平衡 EED 的能力。此外,证明了所提方法提高了 RL 解决复杂运动控制任务的性能。
引用
@article{arxiv.2604.15614,
title = {Flexible Empowerment at Reasoning with Extended Best-of-N Sampling},
author = {Taisuke Kobayashi},
journal= {arXiv preprint arXiv:2604.15614},
year = {2026}
}
备注
15 pages, 4 figures