用于可验证与组合式强化学习的多保真度仿真到现实流水线
机器人学
2023-12-05 v1 人工智能
系统与控制
系统与控制
摘要
我们提出并演示了一个组合式框架,用于在多保真度仿真到现实流水线中训练和验证强化学习(RL)系统,以便在物理硬件上部署可靠且适应性强的 RL 策略。通过将复杂的机器人任务分解为组件子任务并定义它们之间的数学接口,该框架允许对相应的子任务策略进行独立训练和测试,同时对其组合产生的整体行为提供保证。通过使用多保真度仿真流水线验证这些子任务策略的性能,该框架不仅允许高效的 RL 训练,还允许根据仿真与现实之间差异引起的挑战来细化子任务及其接口。在一个实验案例研究中,我们应用该框架训练并部署了一个组合式 RL 系统,该系统成功驾驶了一辆 Warthog 无人地面机器人。
引用
@article{arxiv.2312.01249,
title = {A Multifidelity Sim-to-Real Pipeline for Verifiable and Compositional Reinforcement Learning},
author = {Cyrus Neary and Christian Ellis and Aryaman Singh Samyal and Craig Lennon and Ufuk Topcu},
journal= {arXiv preprint arXiv:2312.01249},
year = {2023}
}