对抗式运动先验可良好替代复杂奖励函数
人工智能
2022-03-30 v1 机器人学
摘要
使用未明确规定的奖励函数训练高维模拟智能体,常导致智能体学到在真实世界中部署时无效的、物理上不可行的策略。为缓解这些不自然行为,强化学习从业者常利用鼓励物理上合理行为的复杂奖励函数。然而,创建手工设计的奖励通常需要繁琐的、劳动密集的调参过程,且这类奖励不易跨平台和任务泛化。我们提出以从动作捕捉演示数据集中学习到的“风格奖励(style reward)”来替代复杂奖励函数。学习到的风格奖励可与任意任务奖励结合,以训练采用自然策略执行任务的策略。这些自然策略也有助于迁移到真实世界。我们基于对抗式运动先验(Adversarial Motion Priors,计算机图形学领域中从参考运动数据集编码风格奖励的方法)进行构建,证明对抗式策略训练方法能够产生无需复杂奖励函数即可迁移到真实四足机器人的行为。我们还证明,从一只德国牧羊犬的若干秒动作捕捉数据中学到的有效风格奖励,可带来具有自然步态转换的节能运动策略。
引用
@article{arxiv.2203.15103,
title = {Adversarial Motion Priors Make Good Substitutes for Complex Reward Functions},
author = {Alejandro Escontrela and Xue Bin Peng and Wenhao Yu and Tingnan Zhang and Atil Iscen and Ken Goldberg and Pieter Abbeel},
journal= {arXiv preprint arXiv:2203.15103},
year = {2022}
}
备注
8 pages, 6 figures, 3 tables