Infoprop Dyna 在 Mini Wheelbot 上的学习赛速实验
机器学习
2026-05-05 v1 机器人学
摘要
强化学习 (RL) 有望使机器人在快速、非线性且不稳定动力学下达到性能极限。然而,近期进展依赖精心设计的物理仿真器和域随机化才能在合理的实际运行时间内实现成功的仿真到现实迁移。本文绕过仿真器需求,展示 Infoprop Dyna—a 领先的不确定性感知模型基强化学习 (MBRL) 框架,能否直接从现实世界交互中使机器人学习完成赛道。使用 Infoprop Dyna,Mini Wheelbot——一个受约束的单轮机器人,在 11 分钟的真实世界经验后即可学习完成赛道。
引用
@article{arxiv.2605.01096,
title = {Learning to Race in Minutes: Infoprop Dyna on the Mini Wheelbot},
author = {Devdutt Subhasish and Henrik Hose and Sebastian Trimpe},
journal= {arXiv preprint arXiv:2605.01096},
year = {2026}
}
备注
Originally submitted to the German Robotics Conference, 2026