中文

结合对比语言-图像联合学习的水下扩散注意力网络用于水下图像增强

计算机视觉与模式识别 2025-05-27 v1

摘要

水下图像常受光吸收、散射、色偏和伪影等复杂退化影响,使得增强对于水生环境中的有效目标检测、识别和场景理解至关重要。现有方法,特别是基于扩散的方法,由于真实水下参考数据的稀缺,通常依赖于合成的成对数据集,这引入了偏差并限制了泛化能力。此外,微调这些模型可能会降低已学习的先验,导致因领域偏移而产生不真实的增强效果。为了应对这些挑战,我们提出了UDAN-CLIP,这是一个在合成水下数据集上预训练的图像到图像扩散框架,并通过基于视觉-语言模型的定制分类器、空间注意力模块和一种新颖的CLIP-Diffusion损失进行增强。该分类器保留了自然的空气内先验并在语义上引导扩散过程,而空间注意力模块则专注于纠正局部退化,如雾化和低对比度。所提出的CLIP-Diffusion损失进一步增强了视觉-文本对齐,并有助于在增强过程中保持语义一致性。所提出的各项改进使我们的UDAN-CLIP模型能够执行更有效的水下图像增强,产生的结果不仅在视觉上引人注目,而且更加真实并保留了细节。这些改进通过定量指标和定性视觉比较得到了一致验证,证明了该模型在具有挑战性的水下条件下纠正失真和恢复自然外观的能力。

关键词

引用

@article{arxiv.2505.19895,
  title  = {Underwater Diffusion Attention Network with Contrastive Language-Image Joint Learning for Underwater Image Enhancement},
  author = {Afrah Shaahid and Muzammil Behzad},
  journal= {arXiv preprint arXiv:2505.19895},
  year   = {2025}
}