中文

NAUTILUS:用于水下场景理解的大型多模态模型

计算机视觉与模式识别 2025-11-03 v1

摘要

水下探索为我们了解地球提供了关键见解,正受到日益增长的关注,因其在资源探索、国家安全等更广泛的应用。我们研究水下场景理解方法,这些方法旨在实现自动化水下探索。水下场景理解任务需要来自多个粒度的多任务感知。然而,缺乏大规模水下多任务指令调优数据集阻碍了该研究的进展。为弥合这一差距,我们构建了NautData,包含145万张图像-文本对,支持八个水下场景理解任务。它使开发和全面评估水下场景理解模型成为可能。水下图像退化是一个广为人知的挑战,干扰水下任务。为提高水下场景理解的鲁棒性,我们引入来自水下成像模型的物理先验,并提出一种可插拔的视觉特征增强(VFE)模块,该模块显式地恢复清晰的水下信息。我们将该模块集成到著名的基线LLaVA-1.5和Qwen2.5-VL中,并构建我们的水下LMM,NAUTILUS。在NautData和公共水下数据集上的实验表明,VFE模块有效地提高了两个基线在大多数支持任务上的性能,从而确保了NAUTILUS在水下场景理解领域的优越性。数据和模型均可在https://github.com/H-EmbodVis/NAUTILUS 上获取。

关键词

引用

@article{arxiv.2510.27481,
  title  = {NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding},
  author = {Wei Xu and Cheng Wang and Dingkang Liang and Zongchuang Zhao and Xingyu Jiang and Peng Zhang and Xiang Bai},
  journal= {arXiv preprint arXiv:2510.27481},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025. Data and models are available at https://github.com/H-EmbodVis/NAUTILUS