动态遗憾收敛分析及一种用于策略内机器人模仿学习的自适应正则化算法
机器人学
2019-07-10 v2 机器学习
摘要
DAgger等策略内模仿学习算法通过执行机器人控制策略、测量性能(损失)、从监督者处获取纠正反馈并生成下一策略来演化该策略。由于迭代间的损失可能不可预测地变化,一个基本问题是在何种条件下该过程最终会收敛到一个稳定策略。如果假设底层轨迹分布是静态(平稳)的,则可以证明DAgger的收敛性。然而,在更现实的机器人模型中,底层轨迹分布是动态的,因为它是策略的函数。近期结果表明,当轨迹分布变化率满足正则条件时,可以证明DAgger的收敛性。在本文中,我们使用在线优化领域的动态遗憾理论重新表述该结果,并表明动态遗憾可应用于任何策略内算法以分析其收敛性与最优性。这些结果启发了一种新算法——自适应策略内正则化(AOR),它确保了收敛条件。我们给出了基于cart-pole平衡与运动基准的仿真结果,表明AOR能在机器人学习过程中显著减小动态遗憾与抖振。据我们所知,这是动态遗憾理论在模仿学习中的首次应用。
引用
@article{arxiv.1811.02184,
title = {Dynamic Regret Convergence Analysis and an Adaptive Regularization Algorithm for On-Policy Robot Imitation Learning},
author = {Jonathan N. Lee and Michael Laskey and Ajay Kumar Tanwani and Anil Aswani and Ken Goldberg},
journal= {arXiv preprint arXiv:1811.02184},
year = {2019}
}