利用因果不变性正则化对抗模仿学习
机器学习
2023-08-21 v1 人工智能
摘要
模仿学习方法用于从专家演示数据集中,通过最小化专家与策略的经验状态占用测度之间的散度度量,来推断马尔可夫决策过程中的策略。对策略的引导信号由作为对抗优化过程一部分的判别器提供。我们观察到该模型容易吸收专家数据中存在的虚假关联。为缓解此问题,我们提出将因果不变性作为这些模型对抗训练的正则化原则。该正则化目标可直接应用于现有对抗模仿框架。我们在具说明性的二维设定以及若干高维机器人运动基准任务中展示了正则化公式的有效性。
引用
@article{arxiv.2308.09189,
title = {Regularizing Adversarial Imitation Learning Using Causal Invariance},
author = {Ivan Ovinnikov and Joachim M. Buhmann},
journal= {arXiv preprint arXiv:2308.09189},
year = {2023}
}
备注
Published at the ICML 2023 Workshop on Spurious Correlations, Invariance, and Stability