中文

从新颖到模仿:基于自蒸馈奖励的离线强化学习

机器学习 2025-12-23 v2

摘要

离线强化学习旨在从静态数据集中学习有效策略,而无需进一步的智能体-环境交互。然而,其实际应用常受限于对明确奖励标注的需求,这类标注往往成本高昂或难以事后获得。为此,我们提出了 ReLOAD(Reinforcement Learning with Offline Reward Annotation via Distillation,基于蒸馈的离线奖励标注),一种用于离线强化学习的新型奖励标注框架。与现有依赖复杂对齐程序的方法不同,我们的方法将随机网络蒸馏(RND)适用于从专家演示中生成内在奖励,采用简单而有效的嵌入差异度度量。首先,我们训练一个预测网络以模仿固定目标网络的嵌入,基于专家状态转换。随后,这些网络之间的预测误差作为静态数据集中每个状态转换的奖励信号。该机制无需人工构建奖励标注,即可提供结构化的奖励信号。我们提供了形式化的理论构造,深入探讨了 RND 预测误差如何通过区分专家式状态转换,有效作为内在奖励。D4RL 基准实验表明,ReLOAD 能够实现稳健的离线策略学习,性能与传统奖励标注方法相称。

关键词

引用

@article{arxiv.2507.12815,
  title  = {From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning},
  author = {Gaurav Chaudhary and Laxmidhar Behera},
  journal= {arXiv preprint arXiv:2507.12815},
  year   = {2025}
}