中文

UWBench:用于 underwater understanding 的综合视觉语言基准

计算机视觉与模式识别 2025-10-22 v1

摘要

大型视觉语言模型 (VLM) 在自然场景理解方面取得了显著成功,但其在水下环境中的应用仍鲜有探索。水下图像呈现独特挑战,包括严重的光衰减、颜色失真和悬浮颗粒散射,同时需要专门的海洋生态系统和生物分类学知识。为弥合这一差距,我们引入 UWBench,一个专为水下视觉语言理解设计的综合基准测试。UWBench 包含 15,003 张高分辨率水下图像,覆盖海洋、珊瑚礁和深海等多样水下环境。每张图像都包含经人工验证的注释,包括 15,281 条对象指代表达精确描述海洋生物和水下结构,以及 124,983 条问答对,涵盖从对象识别到生态关系理解的多样推理能力。数据集捕获了可见性、照明条件和水体浑浊度的丰富变化,为模型评估提供了真实可靠的测试平台。基于 UWBench,我们建立了三个综合性基准:详细图像描述生成生态信息丰富的场景描述、视觉定位精确定位海洋生物、视觉问答进行水下环境的多模态推理。对最新 VLM 进行大规模实验表明,水下理解仍具有挑战性,仍有显著提升空间。我们的基准为推动水下语境下的视觉语言研究提供了 essential 资源,支持海洋科学、生态监测和自主水下探索等应用。我们的代码和基准将对外公开。

关键词

引用

@article{arxiv.2510.18262,
  title  = {UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding},
  author = {Da Zhang and Chenggang Rong and Bingyu Li and Feiyu Wang and Zhiyuan Zhao and Junyu Gao and Xuelong Li},
  journal= {arXiv preprint arXiv:2510.18262},
  year   = {2025}
}

备注

We have released V1, which only reports the test results. Our work is still ongoing, and the next version will be coming soon