中文

触发策略搜索:通过语言和数值推理的强化学习

机器学习 2025-12-01 v1 人工智能

摘要

强化学习(RL)传统上依赖标量奖励信号,限制了其利用实际任务中常可获得的丰富语义知识的能力。相比之下,人类能够通过结合数值反馈、语言、先验知识和常识来高效学习。我们引入触发策略搜索(Prompted Policy Search, ProPS),这是一种新颖的强化学习方法,统一了数值与语言推理于单一框架中。与已有工作不同,ProPS 将大型语言模型(LLM)置于策略优化循环的中心,直接基于奖励反馈和自然语言输入提出策略更新。我们表明 LLM 能够进行原位数值优化,纳入语义信号(如目标、领域知识和策略提示)可导致更有信息的探索和更高效的样本学习。在十五项 Gymnasium 任务(涵盖经典控制、Atari 游戏和 MuJoCo 环境)上进行评估,并与七种广泛采用的强化学习算法(如 PPO、SAC、TRPO)进行比较。实验表明,ProPS 在八十个中的八个任务上均优于所有基线,并在提供领域知识时显示出显著的性能提升。这些结果凸显了统一语义与数值的潜力,以实现透明、可泛化且符合人类取向的强化学习。

关键词

引用

@article{arxiv.2511.21928,
  title  = {Prompted Policy Search: Reinforcement Learning through Linguistic and Numerical Reasoning in LLMs},
  author = {Yifan Zhou and Sachin Grover and Mohamed El Mistiri and Kamalesh Kalirathnam and Pratyush Kerhalkar and Swaroop Mishra and Neelesh Kumar and Sanket Gaurav and Oya Aran and Heni Ben Amor},
  journal= {arXiv preprint arXiv:2511.21928},
  year   = {2025}
}

备注

In The Thirty-ninth Annual Conference on Neural Information Processing Systems