GRACE:可解释逆强化学习的语言模型框架
机器学习
2026-01-29 v2 人工智能
摘要
逆强化学习旨在从专家演示中恢复奖励模型,但传统方法产生的黑盒模型难以解释和调试。在本工作中,我们提出 GRACE(Generating Rewards As CodE),一种利用大型语言模型在进化搜索中从专家轨迹直接逆向工程出可解释的、基于代码的奖励函数的方法。生成的奖励函数是可执行的代码,可以被检查和验证。我们在 MuJoCo、BabyAI 和 AndroidWorld 基准测试上对 GRACE 进行了实证验证,在这些测试中它能高效地学习高度准确的奖励,即使在复杂的多任务设置中也是如此。此外,我们证明,与使用真实奖励的竞争性模仿学习和在线强化学习方法相比,生成的奖励能产生强大的策略。最后,我们展示了 GRACE 能够在多任务设置中构建复杂的奖励 API。
引用
@article{arxiv.2510.02180,
title = {GRACE: A Language Model Framework for Explainable Inverse Reinforcement Learning},
author = {Silvia Sapora and Devon Hjelm and Alexander Toshev and Omar Attia and Bogdan Mazoure},
journal= {arXiv preprint arXiv:2510.02180},
year = {2026}
}