强化学习中 Sim-to-Real 方法综述:基础模型的进展、前景与挑战
机器学习
2025-03-11 v3 人工智能
机器人学
摘要
深度强化学习已被探索并证明在解决机器人、交通、推荐系统等各个领域的决策任务中是有效的。它通过与环境的交互进行学习,并利用收集到的经验更新策略。然而,由于现实世界数据有限以及采取有害行动的后果难以承受,强化学习策略的学习主要局限于模拟器内。这种做法保证了学习过程中的安全性,但在部署时引入了不可避免的 sim-to-real 差距,从而导致性能下降和执行风险。已有尝试利用各种技术解决不同领域的 sim-to-real 问题,尤其是在大型基础模型或语言模型等新兴技术为 sim-to-real 带来启发的时代。据我们所知,本文是第一篇从马尔可夫决策过程的关键要素(状态、动作、转移和奖励)出发正式构建 sim-to-real 技术分类体系的综述。基于该框架,我们涵盖了从经典到最先进方法的全面文献,包括由基础模型赋能的 sim-to-real 技术,并讨论了 sim-to-real 问题在不同领域中值得关注的特殊性。随后,我们总结了使用可用代码或基准的 sim-to-real 性能正式评估流程。我们还提出了挑战与机遇,以鼓励未来对该方向的探索。我们正在积极维护一个代码库,收录最新的 sim-to-real 研究工作,以帮助相关领域的研究人员。
引用
@article{arxiv.2502.13187,
title = {A Survey of Sim-to-Real Methods in RL: Progress, Prospects and Challenges with Foundation Models},
author = {Longchao Da and Justin Turnau and Thirulogasankar Pranav Kutralingam and Alvaro Velasquez and Paulo Shakarian and Hua Wei},
journal= {arXiv preprint arXiv:2502.13187},
year = {2025}
}
备注
19 pages, 6 figures, 5 tables