中文

探索无需额外训练的水下世界分割

计算机视觉与模式识别 2026-03-18 v2 人工智能

摘要

海洋生物的准确分割对生物多样性监测和生态评估至关重要,然而现有的数据集和模型在很大程度上仍局限于陆地场景。为了弥合这一差距,我们引入了 \textbf{AquaOV255},这是首个大规模、细粒度的水下分割数据集,包含 255 个类别和超过 20K 张图像,涵盖了用于开放词汇 (OV) 评估的多种类别。此外,我们通过将 AquaOV255 与另外五个水下数据集整合,建立了首个水下 OV 分割基准 \textbf{UOVSBench},以实现全面评估。与此同时,我们提出了 \textbf{Earth2Ocean},这是一个无需训练的 OV 分割框架,能够在无需任何水下训练的情况下,将陆地视觉-语言模型 (VLM) 迁移到水下领域。Earth2Ocean 包含两个核心组件:几何引导视觉掩码生成器 (\textbf{GMG}),通过自相似几何先验细化视觉特征以进行局部结构感知;以及类别-视觉语义对齐 (\textbf{CSA}) 模块,通过多模态大语言模型推理和场景感知模板构建增强文本嵌入。在 UOVSBench 基准上的大量实验表明,Earth2Ocean 在平均性能上取得了显著提升,同时保持了高效的推理。

关键词

引用

@article{arxiv.2511.07923,
  title  = {Exploring the Underwater World Segmentation without Extra Training},
  author = {Bingyu Li and Tao Huo and Da Zhang and Zhiyuan Zhao and Junyu Gao and Xuelong Li},
  journal= {arXiv preprint arXiv:2511.07923},
  year   = {2026}
}