中文

利用大语言模型的具有不确定奖励链用于强化学习

机器学习 2026-04-16 v1 人工智能 计算与语言 多智能体系统 机器人学

摘要

在强化学习 (RL) 中,设计有效的奖励函数是其核心挑战,然而由于传统方法固有的低效性和不一致性,这一过程仍然具有挑战性且代价高昂。现有方法常依赖大量的手动设计和评估步骤,容易产生冗余,忽视中间决策点的局部不确定性。为解决这些挑战,我们提出了具有不确定奖励链 (CoUR) 的新框架,将大语言模型 (LLM) 集成到 RL 环境的奖励函数设计和评估中。具体而言,我们的 CoUR 引入了结合文本和语义分析的相似度选择机制,用于识别和重用最相关的奖励函数组件。通过减少冗余评估并利用解耦奖励项上的贝叶斯优化,CoUR 实现了对最优奖励反馈的更高效和更稳健的搜索。我们全面评估了 CoUR 在来自 IsaacGym 的九个原创环境中以及 Bidexterous Manipulation 基准中的所有 20 个任务。实验结果表明,CoUR 不仅实现了更好的性能,还显著降低了奖励评估的成本。

关键词

引用

@article{arxiv.2604.13504,
  title  = {Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning},
  author = {Shentong Mo},
  journal= {arXiv preprint arXiv:2604.13504},
  year   = {2026}
}