中文

基于后继特征匹配的非对抗性逆强化学习

机器学习 2025-04-23 v2 人工智能

摘要

在逆强化学习(IRL)中,智能体通过与环境交互来复现专家演示。传统上,IRL 被视为一个对抗性博弈,其中搜索奖励模型的对手通过重复强化学习过程优化奖励。这种基于博弈求解的方法既计算代价高昂又难以稳定。在本工作中,我们提出了一种通过直接策略优化进行 IRL 的新方法:利用回报的线性分解作为后继特征与奖励向量的内积,我们设计了一种通过学习者与专家特征之间差距的策略梯度下降来进行 IRL 的算法。我们的非对抗性方法不需要学习奖励函数,并且可以与现有的演员-评论家强化学习算法无缝结合。值得注意的是,我们的方法在无需专家动作标签的状态仅设置下也能工作,这是行为克隆(BC)无法解决的场景。实验结果表明,我们的方法仅需单个专家演示即可学习,并在各种控制任务上取得了优异的性能。

关键词

引用

@article{arxiv.2411.07007,
  title  = {Non-Adversarial Inverse Reinforcement Learning via Successor Feature Matching},
  author = {Arnav Kumar Jain and Harley Wiltzer and Jesse Farebrother and Irina Rish and Glen Berseth and Sanjiban Choudhury},
  journal= {arXiv preprint arXiv:2411.07007},
  year   = {2025}
}

备注

Accepted to ICLR 2025