中文

利用视觉语言模型赋能语义敏感型水下图像增强

计算机视觉与模式识别 2026-03-16 v1 人工智能 图像与视频处理

摘要

近年来,基于学习的水下图像增强(UIE)技术取得了快速发展。然而,高质量增强输出与自然图像之间的分布迁移可能阻碍下游视觉任务中语义线索的提取,从而限制现有增强模型的适应性。为此,本文提出一种新型学习机制,利用视觉语言模型(VLM)赋能UIE模型以实现语义敏感能力。具体而言,我们的策略首先通过VLM从受损图像生成关键对象的文字描述。随后,一个文本-图像对齐模型将这些相关描述重新映射回图像上,产生空间语义引导图。该图通过双引导机制引导UIE网络工作,该机制结合了跨注意力和显式对齐损失。这迫使网络在图像重建时专注于语义敏感区域的恢复能力,而不是追求全局均匀改善,从而确保关键对象特征的忠实恢复。实验表明,当我们将该策略应用于不同的UIE基线时,能显著提升其在感知质量指标上的性能,并增强其在检测和分割任务上的表现,验证了其有效性和适应性。

引用

@article{arxiv.2603.12773,
  title  = {Empowering Semantic-Sensitive Underwater Image Enhancement with VLM},
  author = {Guodong Fan and Shengning Zhou and Genji Yuan and Huiyu Li and Jingchun Zhou and Jinjiang Li},
  journal= {arXiv preprint arXiv:2603.12773},
  year   = {2026}
}

备注

Accepted as an Oral presentation at AAAI 2026