后收敛仿真到真实的策略迁移:对 Cherry-Picking 的原则性替代方案
机器人学
2025-04-23 v1 机器学习
摘要
学习性方法,特别是强化学习 (RL),已广泛用于开发自主代理人的控制策略,如腿式机器人的运动控制策略。RL 训练通常通过迭代优化策略来最大化预定义奖励(或最小化相应的成本/损失)。从随机初始化的策略开始,经验期望奖励遵循一条总体呈上升趋势的轨迹。虽然某些策略会暂时卡在局部最优位置,但良好定义的训练过程通常会收敛到带有噪声振荡的奖励水平。然而,选择用于实际部署的策略鲜有分析性决策(即仅选择奖励最高的那个),而往往通过试错来完成。为改进仿真到真实的迁移,大多数研究聚焦于收敛前阶段,采用域随机化、多保真度训练、对抗训练和结构创新等技术。然而,这些方法并不能消除奖励不可避免的收敛轨迹和噪声振荡,导致基于经验的策略选择或 Cherry-Picking。本文解决后收敛仿真到真实的迁移问题,通过引入一种基于最坏情况性能迁移优化的原则性方法,形式化为一个凸二次约束线性规划问题。广泛的实验表明其在将基于 RL 的运动控制策略从仿真成功迁移到真实实验室测试方面效果显著。
引用
@article{arxiv.2504.15414,
title = {Post-Convergence Sim-to-Real Policy Transfer: A Principled Alternative to Cherry-Picking},
author = {Dylan Khor and Bowen Weng},
journal= {arXiv preprint arXiv:2504.15414},
year = {2025}
}