中文

感知不确定性的奖励设计过程

机器学习 2025-07-04 v1 机器人学

摘要

设计有效的奖励函数是强化学习(RL)的基石,然而由于传统奖励工程方法固有的低效性与不一致性,这仍然是一个充满挑战的过程。近期进展探索了利用大型语言模型(LLMs)来自动化奖励函数设计。然而,它们在数值优化上的次优表现往往导致奖励质量不尽如人意,而进化搜索范式对仿真资源的利用效率低下,导致设计周期过长且计算开销不成比例。为了应对这些挑战,我们提出了感知不确定性的奖励设计过程(URDP),这是一个集成大型语言模型以简化RL环境中奖励函数设计与评估的新框架。URDP基于自洽性分析量化候选奖励函数的不确定性,能够在无需仿真的情况下识别无效奖励组件,同时发现新的奖励组件。此外,我们引入了感知不确定性的贝叶斯优化(UABO),其结合不确定性估计以显著提升超参数配置效率。最后,我们通过解耦奖励组件优化与超参数调优,构建了双层优化架构。URDP统筹了LLMs的奖励逻辑推理与贝叶斯优化的数值优化优势之间的协同合作。我们在跨越三个基准环境的35个多样化任务上对URDP进行了全面评估。实验结果表明,URDP不仅生成了更高质量的奖励函数,而且与现有方法相比,在自动化奖励设计效率上取得了显著提升。

关键词

引用

@article{arxiv.2507.02256,
  title  = {Uncertainty-aware Reward Design Process},
  author = {Yang Yang and Xiaolu Zhou and Bosong Ding and Miao Xin},
  journal= {arXiv preprint arXiv:2507.02256},
  year   = {2025}
}

备注

34 pages, 9 figures