中文

AquaticCLIP:面向水下场景分析的视觉-语言基础模型

计算机视觉与模式识别 2025-02-05 v1 人工智能

摘要

保护水生生物多样性对于缓解气候变化的影响至关重要。水下场景理解在辅助海洋科学家进行决策过程中扮演着关键角色。在本文中,我们介绍了 AquaticCLIP,这是一种专为水下场景理解而设计的新型对比语言-图像预训练模型。AquaticCLIP 提出了一种新的无监督学习框架,用于对齐水下环境中的图像和文本,从而支持分割、分类、检测和物体计数等任务。通过利用我们大规模的水下图像-文本配对数据集,无需真实标注,我们的模型丰富了水生领域的现有视觉-语言模型。为此,我们利用 YouTube、Netflix、NatGeo 等异构资源构建了一个包含 200 万对水下图像-文本的数据集。为了微调 AquaticCLIP,我们提出了一种提示引导的视觉编码器,通过可学习的提示逐步聚合图像块特征,同时一种视觉引导机制通过结合视觉上下文来增强语言编码器。该模型通过对比预训练损失进行优化,以对齐视觉和文本模态。AquaticCLIP 在多个水下计算机视觉任务的零样本设置中取得了显著的性能提升,在鲁棒性和可解释性方面均优于现有方法。我们的模型为水下环境中的视觉-语言应用设立了新的基准。AquaticCLIP 的代码和数据集已在 GitHub 上公开,地址为 xxx。

关键词

引用

@article{arxiv.2502.01785,
  title  = {AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis},
  author = {Basit Alawode and Iyyakutti Iyappan Ganapathi and Sajid Javed and Naoufel Werghi and Mohammed Bennamoun and Arif Mahmood},
  journal= {arXiv preprint arXiv:2502.01785},
  year   = {2025}
}