MoRI:面向长时域操作任务的强化学习与模仿学习专家混合
机器人学
2026-04-14 v1
摘要
强化学习(RL)和模仿学习(IL)是操作任务中策略获取的标准框架。虽然IL能提供高效的策略推导,但它存在复合误差和分布偏移问题。相反,RL促进自主探索,但常受限于样本效率低和试错成本高。由于现有的混合方法在处理复杂任务时常常遇到困难,我们引入了强化学习与模仿学习专家混合(MoRI)。该系统根据专家动作的方差,在IL和RL专家之间动态切换,以处理粗放运动和精细操作。MoRI采用离线预训练阶段,随后进行在线微调以加速收敛。为保持探索安全性并最小化人工干预,系统对RL组件应用了基于IL的正则化。在四个复杂真实世界任务上的评估表明,MoRI在2到5小时的微调内实现了平均97.5%的成功率。与基线RL算法相比,MoRI将人工干预减少了85.8%,并将收敛时间缩短了21%,展示了其在机器人操作中的能力。
引用
@article{arxiv.2604.10165,
title = {MoRI: Mixture of RL and IL Experts for Long-Horizon Manipulation Tasks},
author = {Yaohang Xu and Lianjie Ma and Gewei Zuo and Wentao Zhang and Han Ding and Lijun Zhu},
journal= {arXiv preprint arXiv:2604.10165},
year = {2026}
}