面向视觉-语言-动作学习的行动专用稀疏专家混合模型 (AdaMoE)
机器人学
2025-10-17 v1 人工智能
摘要
视觉-语言-动作 (VLA) 模型正快速发展并在机器人操作任务中展现出有前景的能力。然而,扩大 VLA 模型存在若干关键挑战:(1) 从头训练新的 VLA 模型需要大量计算资源和大量数据集。鉴于当前机器人数据稀缺,充分利用现成 VLA 模型权重以实现规模化尤其宝贵。(2) 实时控制需要仔细平衡模型容量与计算效率。为此,我们提出了 AdaMoE,这是一种 Mixture-of-Experts (MoE) 架构,继承了稠密 VLA 模型的预训练权重,并通过将前馈层替换为稀疏激活的 MoE 层来扩展动作专家。AdaMoE 采用解耦技术,将专家选择与专家权重通过独立的比例适配器进行解耦,后者与传统路由器协同工作。这使得专家能够基于任务相关性进行选择,并通过独立可控的权重进行贡献,从而实现协作式专家利用而非“胜出者全拿”。我们的方法表明,专业知识不必垄断。通过协作式专家利用,我们可以在保持计算效率的同时实现更佳性能。AdaMoE 在关键基准测试中始终优于基线模型,在 LIBERO 上实现 1.8% 的性能提升,在 RoboTwin 上实现 9.3% 的性能提升。更重要的是,在实际实验中实现了高达 21.5% 的显著改进,验证了其在机器人操作任务中的实际有效性。
引用
@article{arxiv.2510.14300,
title = {Expertise need not monopolize: Action-Specialized Mixture of Experts for Vision-Language-Action Learning},
author = {Weijie Shen and Yitian Liu and Yuhao Wu and Zhixuan Liang and Sijia Gu and Dehui Wang and Tian Nian and Lei Xu and Yusen Qin and Jiangmiao Pang and Xinping Guan and Xiaokang Yang and Yao Mu},
journal= {arXiv preprint arXiv:2510.14300},
year = {2025}
}