来自收敛监督员的策略上机器人模仿学习
机器学习
2020-05-19 v7 人工智能
机器人学
摘要
现有的策略上模仿学习算法,如 DAgger,假定可访问固定监督员。然而,在许多设定中监督员可能在策略学习期间演化,例如执行新颖任务的人或改进中的算法控制器。我们形式化了来自“收敛监督员”的模仿学习,并给出相对于后见中来自收敛监督员标签的最佳策略的亚线性静态与动态后悔保证,即便学习期间的标签仅来自中间监督员。我们随后表明该框架与一类称为对偶策略迭代(DPI)的强化学习(RL)算法紧密关联,后者在以模仿学习训练反应式学习器与以学习器数据训练基于模型的监督员之间交替。实验表明,当该框架以最先进深度基于模型的 RL 算法 PETS 作为改进中监督员应用时,其在连续控制任务上优于深度 RL 基线,并提供高达 80 倍的策略评估加速。
引用
@article{arxiv.1907.03423,
title = {On-Policy Robot Imitation Learning from a Converging Supervisor},
author = {Ashwin Balakrishna and Brijen Thananjeyan and Jonathan Lee and Felix Li and Arsh Zahed and Joseph E. Gonzalez and Ken Goldberg},
journal= {arXiv preprint arXiv:1907.03423},
year = {2020}
}
备注
Conference on Robot Learning (CoRL) 2019 Oral. First two authors contributed equally