利用想象转移学习机器人策略:缓解鲁棒性与最优性之间的权衡
机器人学
2025-09-23 v2
摘要
现有的四足动物 locomotion 学习范式通常依赖大量域随机化以弥补 sim2real 差距并增强鲁棒性。它通过训练在广泛环境参数和传感器噪声下都能可靠运行的策略来实现这一目标。然而,由于在理想条件下的最优性能与处理最坏情况的需求相冲突,最优性和鲁棒性之间存在权衡。这种权衡迫使所学策略优先在多样化且具挑战性的条件下保持稳定,而在理想条件下追求效率和准确性,导致过于保守的行为以牺牲峰值性能为代价。本文提出一种两阶段框架,通过整合想象转移来缓解这种权衡。该框架通过将想象转移作为示教输入集成到常规强化学习(RL)方法中来增强其性能。这些想象转移源自在理想设置下运行的 optimal policy 和 dynamics model。我们的发现表明,这种方法显著减轻了现有 RL 算法由域随机化引起的负面影响,导致训练加速,分布内跟踪误差降低,分布外鲁棒性提升。
引用
@article{arxiv.2503.10484,
title = {Learning Robotic Policy with Imagined Transition: Mitigating the Trade-off between Robustness and Optimality},
author = {Wei Xiao and Shangke Lyu and Zhefei Gong and Renjie Wang and Donglin Wang},
journal= {arXiv preprint arXiv:2503.10484},
year = {2025}
}