中文

LocoMamba:基于 Mamba 的视觉驱动 locomotion 深度强化学习框架

机器人学 2025-12-16 v3 人工智能 计算机视觉与模式识别 系统与控制 图像与视频处理 系统与控制

摘要

我们提出了 LocoMamba,一个基于选择性时序模型(Specifically leveraging Mamba)的视觉驱动跨模态 DRL 框架,实现近线性时间序列建模,有效捕获长程依赖关系,并在更长序列上实现高效训练。首先,我们使用多层感知器将本体感知状态嵌入,并使用轻量级卷积神经网络对深度图像进行 patch 化,产生紧凑 token 以 improved 状态表征。其次,堆叠的 Mamba 层通过近线性时间选择性扫描融合这些 token,降低延迟和内存占用,保持对 token 长度和图像分辨率的鲁棒性,并提供一种正则化偏差以缓解过拟合。最后,我们在地形和外观随机化以及障碍密度 curriculum 下使用紧凑以状态为中心的奖励进行端到端训练,以平衡 progress、smoothness 和 safety。我们在具有静态和移动障碍物以及不均匀地形的具有挑战性的模拟环境中评估了该方法。与最先进的基线方法相比,我们的方法在更少的碰撞次数下实现更高的回报和成功率, exhibits stronger 对未见地形和障碍密度的 generalization,并在相同计算预算下通过更少的更新实现更快的训练效率。

关键词

引用

@article{arxiv.2508.11849,
  title  = {LocoMamba: Vision-Driven Locomotion via End-to-End Deep Reinforcement Learning with Mamba},
  author = {Yinuo Wang and Gavin Tao},
  journal= {arXiv preprint arXiv:2508.11849},
  year   = {2025}
}

备注

14 pages. This paper has been published in Advanced Engineering Informatics. Please cite the journal version: DOI: 10.1016/j.aei.2025.104230