面向即时适应的仿真锚定学习
机器人学
2025-05-02 v3 机器学习
摘要
使用真实世界数据对仿真训练的强化学习(RL)智能体进行微调,常因数据分布有限或偏斜而损害关键行为。我们认为,设计者的优先级不仅存在于奖励函数中,也存在于任务选择和状态初始化等仿真设计选择中。当适应真实世界数据时,智能体可能在重要但代表性不足的场景中发生灾难性遗忘。我们提出将在线适应视为一个多目标优化问题,其中策略目标必须在仿真和现实中同时满足。我们的方法利用来自仿真的评价器作为“设计意图锚点”(锚定评价器)。通过联合优化策略以同时对抗锚定评价器和在真实世界经验上训练的评价器,我们的方法能够在适应的同时保留仿真中的优先行为。评估表明,在仿真到仿真基准以及使用竞速四旋翼的仿真到现实场景中均实现了稳健的行为保持,可在不丢失控制的情况下将功耗降低多达50%。我们还贡献了SwaNNFlight,一个用于在类似机器人平台上实现在线适应的开源固件。
引用
@article{arxiv.2301.06987,
title = {Sim-Anchored Learning for On-the-Fly Adaptation},
author = {Bassel El Mabsout and Shahin Roozkhosh and Siddharth Mysore and Kate Saenko and Renato Mancuso},
journal= {arXiv preprint arXiv:2301.06987},
year = {2025}
}