中文

SaiVLA-0:基于计算感知的 Cerebrum--Pons--Cerebellum 三联体视觉-语言-动作架构

机器人学 2026-03-10 v1 人工智能 机器学习

摘要

我们通过神经科学启发的三元结构重新审视视觉-语言-动作。生物学上, Cerebrum 提供稳定的高层多模态先验且保持冻结状态; Pons 适配器将这些皮层特征与实时感觉输入集成, 并将意图编译为执行就绪 token; Cerebellum(ParaCAT)执行快速、并行的分类解码以实现在线控制, 采用滞后性/指数移动平均/温度/熵以提升稳定性。固定比率计划和两阶段特征缓存使系统具备计算感知和可重复性。受主动、眼斑视觉启发, 我们的腕部 ROI 与机械臂末端执行器通过校准投影几何关联, 提供运动稳定的高分辨率视角, 对细粒度姿态变化敏感, 并补充主视角的全局上下文。该设计模块化:仅升级 Cerebrum 即可重新训练 Pons;更换机器人仅需训练 Cerebellum; Cerebellum-only RL 可进一步优化控制而不触动高层语义。作为概念与协议论文, 我们在匹配条件(GPU、分辨率、batch)下概述时间协议以验证预期的效率提升。我们还报告了在官方 N1.5 仅训练头的情况下的 LIBERO 初步结果, 显示分层特征缓存将训练时间从 7.5 小时缩短至 4.5 小时, 平均成功率从 86.5% 提升至 92.5%, 且 SaiVLA0 达到 99.0% 的平均成功率。

关键词

引用

@article{arxiv.2603.08124,
  title  = {SaiVLA-0: Cerebrum--Pons--Cerebellum Tripartite Architecture for Compute-Aware Vision-Language-Action},
  author = {Xiang Shi and Wenlong Huang and Menglin Zou and Xinhai Sun},
  journal= {arXiv preprint arXiv:2603.08124},
  year   = {2026}
}

备注

14 pages, 3 figures