中文

UnderwaterVLA:用于自主水下导航的双脑视觉-语言-动作架构

机器人学 2025-09-29 v1

摘要

本文提出了 UnderwaterVLA,一种将多模态基础模型与具身智能系统相结合的自主水下导航新框架。由于流体动力学扰动、有限的通信带宽以及浑浊水域中退化的传感能力,水下作业仍然面临困难。为了应对这些挑战,我们引入了三项创新。首先,双脑架构将高层任务推理与低层反应控制解耦,从而在通信和计算约束下实现稳健操作。其次,我们首次将 Vision-Language-Action (VLA) 模型应用于水下机器人,并结合结构化的思维链推理以实现可解释的决策。第三,流体动力学知情的 Model Predictive Control (MPC) 方案实时补偿流体效应,无需昂贵的特定任务训练。实地测试中的实验结果表明,UnderwaterVLA 在退化视觉条件下减少了导航误差,同时任务完成率比基线高出 19% 至 27%。通过最小化对水下特定训练数据的依赖并提高跨环境的适应性,UnderwaterVLA 为下一代智能 AUV 提供了一条可扩展且具有成本效益的路径。

关键词

引用

@article{arxiv.2509.22441,
  title  = {UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation},
  author = {Zhangyuan Wang and Yunpeng Zhu and Yuqi Yan and Xiaoyuan Tian and Xinhao Shao and Meixuan Li and Weikun Li and Guangsheng Su and Weicheng Cui and Dixia Fan},
  journal= {arXiv preprint arXiv:2509.22441},
  year   = {2025}
}

备注

This paper introduces the first VLA framework for AUVs, featuring a dual-brain architecture and zero-data MPC for real-world underwater navigation