从 corrupted 演示中进行鲁棒模仿学习
机器学习
2022-02-01 v1 人工智能
机器学习
摘要
我们考虑从 corrupted 演示中进行离线模仿学习,其中恒定比例的数据可能为噪声甚至任意异常值。行为克隆(Behavior Cloning)等经典方法假设演示由 presumably 最优专家收集,因此在从 corrupted 演示学习时可能严重失败。我们提出一种新颖的鲁棒算法,通过最小化均值中位数(Median-of-Means,MOM)目标,即使在存在恒定比例异常值的情况下也能保证策略的准确估计。我们的理论分析表明,在 corrupted 设定下,我们的鲁棒方法享有与专家演示设定下经典行为克隆几乎相同的误差缩放与样本复杂度保证。我们在连续控制基准上的实验验证了我们的方法展现出预期的鲁棒性与有效性,并与现有模仿学习方法相比取得了有竞争力的结果。
引用
@article{arxiv.2201.12594,
title = {Robust Imitation Learning from Corrupted Demonstrations},
author = {Liu Liu and Ziyang Tang and Lanqing Li and Dijun Luo},
journal= {arXiv preprint arXiv:2201.12594},
year = {2022}
}