感知不确定性的奖励设计过程
机器学习
2025-07-04 v1 机器人学
摘要
设计有效的奖励函数是强化学习(RL)的基石,然而由于传统奖励工程方法固有的低效性与不一致性,这仍然是一个充满挑战的过程。近期进展探索了利用大型语言模型(LLMs)来自动化奖励函数设计。然而,它们在数值优化上的次优表现往往导致奖励质量不尽如人意,而进化搜索范式对仿真资源的利用效率低下,导致设计周期过长且计算开销不成比例。为了应对这些挑战,我们提出了感知不确定性的奖励设计过程(URDP),这是一个集成大型语言模型以简化RL环境中奖励函数设计与评估的新框架。URDP基于自洽性分析量化候选奖励函数的不确定性,能够在无需仿真的情况下识别无效奖励组件,同时发现新的奖励组件。此外,我们引入了感知不确定性的贝叶斯优化(UABO),其结合不确定性估计以显著提升超参数配置效率。最后,我们通过解耦奖励组件优化与超参数调优,构建了双层优化架构。URDP统筹了LLMs的奖励逻辑推理与贝叶斯优化的数值优化优势之间的协同合作。我们在跨越三个基准环境的35个多样化任务上对URDP进行了全面评估。实验结果表明,URDP不仅生成了更高质量的奖励函数,而且与现有方法相比,在自动化奖励设计效率上取得了显著提升。
引用
@article{arxiv.2507.02256,
title = {Uncertainty-aware Reward Design Process},
author = {Yang Yang and Xiaolu Zhou and Bosong Ding and Miao Xin},
journal= {arXiv preprint arXiv:2507.02256},
year = {2025}
}
备注
34 pages, 9 figures