中文

USIM与U0:通用 underwater 机器人的数据集与模型

机器人学 2026-05-25 v4

摘要

水下环境为机器人导航与操控带来独特挑战。虽然已有研究主要聚焦于特定任务方法,但针对通用智能以实现多任务执行的研究仍寥寥。为填补这一空白,我们提出了面向通用水下机器人的统一框架,该框架集成感知与动作,由语言指令驱动。首先,我们开发了数据合成管线,构建USIM数据集,包含超过90.5万帧数据,涵盖2275条轨迹,总时长约25小时的BlueROV2交互。此外,我们提出U0,一种视觉-语言-动作(VLA)模型,能执行各种任务,从障碍规避导航到三维移动操控。该模型具备卷积-注意力感知(CAP)模块,集成目标姿态估计作为辅助任务,以明确强化模型的空间感知能力。为评估,我们建立系统化评估框架及自动化管线,涵盖离线指标与在线任务执行。实验结果表明,USIM数据集显著赋能现有VLA模型适应水下场景。值得注意的是,U0模型实现了最先进性能:将离线平均动作预测误差降至0.0359,实现整体在线成功率43.1%,显著优于现有竞争性基线(低于37.6%),其中导航任务最高可达87.5%。这些结果验证了水下机器人通用智能的可行性,为可扩展的数据集合成与水生具身智能体提供了基础。

关键词

引用

@article{arxiv.2510.07869,
  title  = {USIM and U0: A Vision-Language-Action Dataset and Model for General Underwater Robots},
  author = {Junwen Gu and Zhiheng Wu and Pengxuan Si and Shuang Qiu and Zhentao Zhang and Yukai Feng and Luoyang Sun and Laien Luo and Lianyi Yu and Jian Wang and Zhengxing Wu},
  journal= {arXiv preprint arXiv:2510.07869},
  year   = {2026}
}

备注

Project Page: https://vincentgu2000.github.io/u0project/