FedVLA:面向机器人操作的联邦视觉-语言-动作学习与双门控混合专家方法
机器人学
2025-08-05 v1 人工智能
摘要
视觉-语言-动作(VLA)模型通过使机器人能够理解语言指令以执行任务,从而显著推动了机器人操作的发展。然而,这些模型的训练往往依赖于大规模的用户特定数据,引发了隐私与安全方面的担忧,进而限制了其更广泛的推广应用。为解决这一问题,我们提出 FedVLA——首个联邦 VLA 学习框架,能够在保护数据隐私的同时实现分布式模型训练,且不牺牲性能。我们的框架集成了任务感知的表征学习、自适应的专家选择以及专家驱动的联邦聚合,从而实现高效且保护隐私的 VLA 模型训练。具体而言,我们引入了一种面向指令的场景解析(Instruction Oriented Scene-Parsing)机制,该机制能够基于任务指令对目标级特征进行分解与增强,从而提升上下文理解能力。为了有效学习多样化的任务模式,我们设计了双门控混合专家(Dual Gating Mixture-of-Experts, DGMoE)机制,其中不仅输入 token,自感知的专家也能自适应地决定其激活状态。最后,我们在联邦服务器端提出了一种专家驱动的聚合(Expert-Driven Aggregation)策略,通过已激活的专家来指导模型聚合,从而确保跨客户端知识的有效迁移。大量的仿真与真实机器人实验证明了我们所提方案的有效性。值得注意的是,DGMoE 相比其原始版本显著提升了计算效率,而 FedVLA 则取得了与集中式训练相当的任务成功率,有效保护了数据隐私。
引用
@article{arxiv.2508.02190,
title = {FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation},
author = {Cui Miao and Tao Chang and Meihan Wu and Hongbin Xu and Chun Li and Ming Li and Xiaodong Wang},
journal= {arXiv preprint arXiv:2508.02190},
year = {2025}
}
备注
Accepted by ICCV 2025