中文

马尔可夫平衡满足提升严格批量离线模仿学习的性能

机器学习 2024-08-20 v1 人工智能

摘要

模仿学习 (IL) 对于直接编程行为或定义最优控制成本具有挑战性的机器人任务特别有效。在这项工作中,我们解决了一个场景,其中模仿者在学习期间仅依赖观察到的行为,不能与环境进行交互。它没有超出专家数据集的额外补充数据集,也没有任何关于转移动态的信息。与最先进的 (SOTA) IL 方法不同,此方法通过在更受限和更现实的设置中运行来解决传统 IL 的局限性。我们的方法使用马尔可夫平衡方程,并引入了一种新颖的基于条件密度估计的模仿学习框架。它采用条件归一化流进行转移动态估计,并旨在满足环境的平衡方程。通过在 Classic Control 和 MuJoCo 环境上的一系列数值实验,我们证明了与许多 SOTA IL 算法相比,我们的方法具有一致优越的经验性能。

关键词

引用

@article{arxiv.2408.09125,
  title  = {Markov Balance Satisfaction Improves Performance in Strictly Batch Offline Imitation Learning},
  author = {Rishabh Agrawal and Nathan Dahlin and Rahul Jain and Ashutosh Nayyar},
  journal= {arXiv preprint arXiv:2408.09125},
  year   = {2024}
}