面向连续控制中的泛化与简洁性
机器学习
2018-03-21 v2 人工智能
机器人学
系统与控制
摘要
本工作表明,具有简单线性和 RBF 参数化的策略可被训练以解决多种连续控制任务,包括 OpenAI gym 基准。这些训练所得策略的性能与最先进的(SOTA)结果相当,后者通过全连接神经网络等更复杂的参数化获得。此外,现有的训练和测试场景被证明非常有限且易于过拟合,从而仅产生轨迹中心策略。研究表明,使用多样化的初始状态分布进行训练可产生具有更好泛化能力的更全局策略。这使得交互式控制场景成为可能,其中系统能从大的在线扰动中恢复;如补充视频所示。
引用
@article{arxiv.1703.02660,
title = {Towards Generalization and Simplicity in Continuous Control},
author = {Aravind Rajeswaran and Kendall Lowrey and Emanuel Todorov and Sham Kakade},
journal= {arXiv preprint arXiv:1703.02660},
year = {2018}
}
备注
NIPS 2017, Project page: https://sites.google.com/view/simple-pol