恢复扩散基于策略中的隐藏奖励
机器人学
2026-05-12 v2
摘要
本文引入 EnergyFlow 框架,将生成式动作建模与逆强化学习统一起来,通过参数化一个标量能量函数,其梯度为去噪场。我们建立,在最大熵最优性下,利用去噪得分匹配学习到的得分函数可恢复专家软 Q 函数的梯度,从而实现无需对抗训练的奖励提取。形式上,我们证明,将所学场约束为保守的可减少假设复杂度并紧致 out-of-distribution 概念泛化界限。我们进一步 characterize 所恢复奖励的可识别性,并界定得分估计误差如何传播到动作偏好。经验上,EnergyFlow 在各种操控任务上实现了最先进的模仿性能,同时为下游强化学习提供有效的奖励信号,超越了对抗 IRL 方法和似然基于方法。这些结果表明,有效奖励提取所需的结构约束同时也作为有益的归纳偏置促进策略泛化。代码地址为 https://github.com/sotaagi/EnergyFlow。
引用
@article{arxiv.2605.00623,
title = {Recovering Hidden Reward in Diffusion-Based Policies},
author = {Yanbiao Ji and Qiuchang Li and Yuting Hu and Shaokai Wu and Wenyuan Xie and Guodong Zhang and Qicheng He and Deyi Ji and Yue Ding and Hongtao Lu},
journal= {arXiv preprint arXiv:2605.00623},
year = {2026}
}
备注
Accepted by ICML 2026