PAMAE:面向可靠流匹配视觉-语言-动作策略的相位感知MoE动作专家
机器人学
2026-06-25 v1
摘要
多阶段机器人操作的可靠动作生成对视觉-语言-动作(VLA)模型而言仍具挑战。尽管现有流匹配VLA策略提供强多模态接地与泛化能力,它们通常采用单一共享动作专家,限制了捕获不同执行阶段中相位特定控制模式的能力。我们提出即插即用的相位感知混合专家动作模块(PAMAE),作为迈向更可靠相位一致动作生成的一步。PAMAE以稀疏专家混合替换原始流匹配动作专家,同时保留预训练VLA主干。PAMAE引入相位感知路由器,利用执行相位线索跨专家分配动作生成,并由轻量相位预测头和路由对齐目标支持。为稳定专业化,我们采用两阶段训练方案:先在标准流匹配损失下预热专家模块,再在辅助监督下优化相位一致路由。在多阶段操作仿真任务上,PAMAE比强VLA基线提升任务成功率至多\textbf{9.2\%}。进一步消融表明相位监督路由与分阶段优化对观测收益均不可或缺。我们的结果凸显相位一致专家分配作为改进流匹配VLA策略可靠性与动作质量的有效机制。
引用
@article{arxiv.2606.27144,
title = {PAMAE: Phase-Aware-MoE Action Experts Towards Reliable Flow-Matching Vision-Language-Action Policies},
author = {Jiayu Yang and Tao Yang and Xiang Chang and Fei Chao and Changjing Shang and Qiang Shen},
journal= {arXiv preprint arXiv:2606.27144},
year = {2026}
}