FLOWER:利用高效视觉-语言-动作流策略实现通用机器人策略的民主化
机器人学
2025-09-08 v1
摘要
开发高效的视觉-语言-动作(VLA)策略对于实际机器人部署至关重要,然而当前方法面临高昂的计算成本和资源需求。现有的基于扩散的VLA策略需要数十亿参数的模型和庞大的数据集才能实现强大性能。我们通过两项贡献来应对这一效率挑战:中间模态融合,通过剪枝高达的LLM层将容量重新分配给扩散头;以及动作特定的Global-AdaLN条件化,通过模块化适配将参数减少。我们将这些进展集成到一个名为FLOWER的新型950M参数VLA中。FLOWER仅在200个H100 GPU小时内完成预训练,在跨越十个仿真和真实世界基准的个任务中,其性能与更大的VLA相比具有竞争力,并展示了跨不同机器人形态的鲁棒性。此外,FLOWER在CALVIN ABC基准上达到了4.53的新SOTA。演示、代码和预训练权重可在https://intuitive-robots.github.io/flower_vla/获取。
引用
@article{arxiv.2509.04996,
title = {FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies},
author = {Moritz Reuss and Hongyi Zhou and Marcel Rühle and Ömer Erdinç Yağmurlu and Fabian Otto and Rudolf Lioutikov},
journal= {arXiv preprint arXiv:2509.04996},
year = {2025}
}
备注
Published at CoRL 2025