面向自主叉车的异构多专家强化学习:长期序时多目标任务
机器人学
2026-01-13 v1 人工智能
摘要
在非结构化仓库中,自动移动操作臂装备需要在高效的大规模导航与高精度物体交互之间取得平衡。传统的端到端学习方法往往难以处理这两种不同阶段的冲突需求。导航依赖于对大范围空间的稳健决策,而操作则需要对细微局部细节高度敏感。强制单一网络同时学习这些不同目标常导致优化干扰,改进一个任务会损害另一个任务。为此,我们提出了针对自动叉车的异构多专家强化学习(HMER)框架。HMER将长期任务分解为由语义任务规划器控制的专门子策略。该结构将宏观导航与微观操作分离,使每个专家能够在其特定动作空间内专注于自身任务,避免相互干扰。规划器协调这些专家的顺序执行,桥接任务规划与连续控制之间的差距。此外,为解决稀疏探索问题,我们引入了混合模仿-强化学习训练策略。该方法使用专家演示初始化策略,并使用强化学习进行微调。在Gazebo仿真实验中,HMER显著优于顺序方法和端到端基线。该方法实现了94.2%的任务成功率(相较于基线的62.5%),操作时间缩短21.4%,且放置误差保持在1.5厘米以内,验证了其在精确物料搬运中的有效性。
引用
@article{arxiv.2601.07304,
title = {Heterogeneous Multi-Expert Reinforcement Learning for Long-Horizon Multi-Goal Tasks in Autonomous Forklifts},
author = {Yun Chen and Bowei Huang and Fan Guo and Kang Song},
journal= {arXiv preprint arXiv:2601.07304},
year = {2026}
}
备注
9 pages