Align-Then-stEer:通过统一潜在引导适配视觉语言动作模型
机器人学
2025-09-08 v2 人工智能
摘要
预训练于大规模、多样化数据集的视觉语言动作(Vision-Language-Action, VLA)模型显示出巨大的潜力,用于通用机器人操纵。然而,适配这些模型以适应下游任务仍是一个主要瓶颈,尤其是当机器人的 embodiment 或任务本身与预训练数据不同时。这一差异导致动作分布之间的显著不匹配,需要大量数据和计算资源才能有效微调。为解决这一挑战,我们引入了一种新型的数据高效、即插即用的适配框架Align-Then-stEer(\texttt{ATE})。\texttt{ATE}首先通过构建统一潜在空间来对 disparate action spaces 进行对齐,在该空间中,受逆KL发散约束的变分自编码器将适配动作嵌入到预训练动作潜在分布的模式中。随后,它通过一种引导机制将VLA基于扩散或流的生成过程推动到目标域。我们在跨 embodiment 和跨任务的操纵中对该方法进行了广泛实验,包括仿真和真实世界环境。与对代表性VLA模型进行直接微调相比,我们的方法在仿真环境中将平均多任务成功率提高了最高可达9.8%,在真实世界的跨 embodiment 环境中实现了惊人的32%成功率提升。我们的工作为将VLA模型部署到新的机器人平台和任务提供了一种通用且轻量级的解决方案。
引用
@article{arxiv.2509.02055,
title = {Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance},
author = {Yang Zhang and Chenwei Wang and Ouyang Lu and Yuan Zhao and Yunfei Ge and Zhenglong Sun and Xiu Li and Chi Zhang and Chenjia Bai and Xuelong Li},
journal= {arXiv preprint arXiv:2509.02055},
year = {2025}
}
备注
The first three authors contributed equally