中文

ABot-M0:基于动作流形学习的机器人操控 VLA 基础模型

计算机视觉与模式识别 2026-04-15 v2 计算与语言 机器人学

摘要

跨异构硬件构建通用具身智能体仍是机器人领域的核心挑战,常以“一脑多形”范式呈现。进展受限于数据碎片化、表征不一致和训练目标错位。我们提出 ABot-M0,一个构建系统数据清理管道同时联合优化模型架构和训练策略的框架,使异构原始数据可端到端转化为统一高效表征。从六个公开数据集中,我们清理、标准化并平衡样本,构建覆盖多样机器人形态和任务场景的 UniACT 数据集,拥有超过 600 万条轨迹和 9500 小时的数据。统一预训练提升知识迁移和跨平台任务的泛化能力,支持通用具身智能。为提高动作预测效率和稳定性,我们提出动作流形假设:有效机器人动作并不位于完整的高维空间中,而是在由物理法则和任务约束支配的低维光滑流形上。基于此,我们引入动作流形学习(AML),使用 DiT 主干网络直接预测干净连续动作序列。这一方法将学习从去噪转向对可行流形的投影,提高解码速度和策略稳定性。ABot-M0 支持通过双流机制实现模块化感知,将 VLM 语义与几何先验集成,并支持来自 VGGT 和 Qwen-Image-Edit 等即插即用 3D 模块的多视角输入,增强空间理解,同时不修改主干网络,缓解标准 VLM 在 3D 推理中的局限。实验表明各组件可独立运行且叠加有效。我们将发布全部代码和管道以便可重复性和未来研究。

关键词

引用

@article{arxiv.2602.11236,
  title  = {ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning},
  author = {Yandan Yang and Shuang Zeng and Tong Lin and Xinyuan Chang and Dekang Qi and Junjin Xiao and Haoyun Liu and Ronghan Chen and Yuzhi Chen and Dongjie Huo and Feng Xiong and Xing Wei and Zhiheng Ma and Mu Xu},
  journal= {arXiv preprint arXiv:2602.11236},
  year   = {2026}
}

备注

Project website: https://amap-cvlab.github.io/ABot-Manipulation/ . Code: https://github.com/amap-cvlab/ABot-Manipulation . 22 pages, 10 figures, 10 tables