由轨迹优化引导的对抗正则化策略学习
机器人学
2022-04-07 v3 机器学习
摘要
近期在将轨迹优化与函数逼近(尤其是神经网络)相结合方面的进展,显示出在机器人系统中学习复杂控制策略以完成多样任务的潜力。尽管具有极大的灵活性,用于参数化控制策略的大型神经网络仍带来了显著挑战。所学得的神经控制策略往往过度复杂且不平滑,容易引发意外或发散的机器人运动,因此在实践中常表现出较差的泛化性能。为解决此问题,我们提出由轨迹优化引导的对抗正则化策略学习(VERONICA),用于学习平滑的控制策略。具体而言,我们所提方法通过稳定输出控制相对于输入状态最坏情况扰动的鲁棒性,来控制神经控制策略的平滑性(局部 Lipschitz 连续性)。我们在机器人操作上的实验表明,所提方法不仅提升了神经策略学习的样本效率,还增强了策略针对各类扰动(包括传感器噪声、环境不确定性与模型失配)的鲁棒性。
引用
@article{arxiv.2109.07627,
title = {Adversarially Regularized Policy Learning Guided by Trajectory Optimization},
author = {Zhigen Zhao and Simiao Zuo and Tuo Zhao and Ye Zhao},
journal= {arXiv preprint arXiv:2109.07627},
year = {2022}
}
备注
Accepted at L4DC 2022