从净化后的演示数据中学习模仿
机器学习
2024-08-07 v2
摘要
模仿学习已成为解决序列决策问题的一种有前景的方法,其假设专家演示是最优的。然而,在真实场景中,大多数演示往往是不完美的,这给模仿学习的有效性带来了挑战。现有研究集中于利用不完美演示进行优化,但训练通常需要一定比例的最优演示以保证性能。为解决这些问题,我们提出先净化不完美演示中的潜在噪声,随后从这些净化后的演示中进行模仿学习。受扩散模型成功的启发,我们引入了一种通过扩散过程的两步净化方法。第一步,我们应用前向扩散过程,通过引入额外噪声来平滑不完美演示中的潜在噪声。随后,利用反向生成过程从扩散后的演示中恢复最优演示。我们提供了支持我们方法的理论证据,表明净化后演示与最优演示之间的距离可以有界。在MuJoCo和RoboSuite上的实证结果从多个方面证明了我们方法的有效性。
引用
@article{arxiv.2310.07143,
title = {Imitation Learning from Purified Demonstrations},
author = {Yunke Wang and Minjing Dong and Yukun Zhao and Bo Du and Chang Xu},
journal= {arXiv preprint arXiv:2310.07143},
year = {2024}
}
备注
ICML 2024