中文

UW-VOS:面向水下视频对象分割的大规模数据集

计算机视觉与模式识别 2026-03-26 v1

摘要

水下视频对象分割(Underwater Video Object Segmentation, VOS)是海洋探索中的关键任务,但现有空中方法因颜色失真、对比度低及伪装现象普遍而性能显著下降。其主要挑战在于缺乏高质量的训练数据。为弥合这一鸿沟,我们引入了——**UW-VOS**,首个大规模水下 VOS 数据集,包含 1,431 个视频序列、409 个类别,标注 309,295 个掩码,通过半自动数据引擎构建,经严格的人类验证。我们进一步提出了——**SAM-U**,一个参数高效框架,将 SAM2 适配至水下领域。通过在图像编码器中插入轻量级适配器,SAM-U 仅需约 2% 可训练参数即可实现最先进性能。大量实验表明,现有方法在 UW-VOS 上平均会下降 13 分的 J&F\mathcal{J}\&\mathcal{F} 指标,而 SAM-U 有效弥合了该领域间的差距。详细的属性基准分析进一步指出,小目标、伪装以及退出再进入是关键瓶颈,为后续在鲁棒水下感知领域的研究提供了路线图。

关键词

引用

@article{arxiv.2603.24006,
  title  = {UW-VOS: A Large-Scale Dataset for Underwater Video Object Segmentation},
  author = {Hongshen Zhao and Jingkang Tai and Yuhang Wu and Wenkang Zhang and Xi Lan and Shangyan Wang and Tianyu Zhang and Wankou Yang},
  journal= {arXiv preprint arXiv:2603.24006},
  year   = {2026}
}