基于专家接近性的单演示行为学习中的代理奖励
机器学习
2024-07-09 v3
摘要
本文聚焦于单演示行为学习(Imitation Learning, IL),这是一种在实际应用中实用的方法,因为获取多个专家演示成本高昂或不可行,且不存在真实奖励函数。在与典型的多演示 IL 设置不同,单演示 IL 指智能体仅获得一个专家轨迹。我们强调了此设置中稀疏奖励信号的问题,并通过提出的基于转换判别器的 IL 方法(TDIL)来缓解这一问题。TDIL 是一种针对奖励稀疏性问题的 IRL 方法,通过引入考虑环境动力学的更密集的代理奖励函数来实现。该代理奖励函数鼓励智能体导航至靠近专家状态的状态。在实践中,TDIL 通过训练转换判别器来区分给定环境中有效与无效的转换,从而计算代理奖励。实验结果表明,TDIL 在 MuJoCo 五个广泛采用的基准测试以及 Adroit Door 机器人环境中的单演示 IL 设置下,优于现有的 IL 方法,实现了专家水平的性能。
引用
@article{arxiv.2402.01057,
title = {Expert Proximity as Surrogate Rewards for Single Demonstration Imitation Learning},
author = {Chia-Cheng Chiang and Li-Cheng Lan and Wei-Fang Sun and Chien Feng and Cho-Jui Hsieh and Chun-Yi Lee},
journal= {arXiv preprint arXiv:2402.01057},
year = {2024}
}
备注
Published at ICML 2024. Code: https://github.com/stanl1y/tdil