中文

水下目标检测挑战与解决方案的结构性综述:从传统方法到大型视觉语言模型

计算机视觉与模式识别 2025-09-11 v1 人工智能

摘要

水下目标检测(UOD)是多种海洋应用的关键任务,包括海洋学研究、 underwater 机器人和海洋保育。然而,UOD 面临诸多挑战,制约了其性能。多年来提出了各种方法以解决这些问题,但往往未能充分捕捉水下环境的复杂性。本综述系统性地将 UOD 挑战分为五个关键领域:图像质量退化、目标相关问题、数据相关挑战、计算和处理限制,以及检测方法的局限性。为解决这些挑战,我们分析了从传统图像处理和目标检测技术向现代方法的演进。此外,我们探讨了大型视觉语言模型(LVLMs)在 UOD 中的潜力,利用其在其他领域展示的多模态能力。我们还包括案例研究,包括使用 DALL-E 3 生成合成数据集以及针对 UOD 对 Florence-2 LVLM 进行微调。本综述确定了三个关键见解:(i)当前 UOD 方法不足以完全解决图像退化和小目标检测在动态水下环境中的挑战。(ii)利用 LVLMs 生成合成数据显示出增强数据集的潜力,但需进一步细化以确保真实性和适用性。(iii)LVLMs 在 UOD 中前景广阔,但其实时应用仍未得到充分探索,需要进一步研究优化技术。

关键词

引用

@article{arxiv.2509.08490,
  title  = {A Structured Review of Underwater Object Detection Challenges and Solutions: From Traditional to Large Vision Language Models},
  author = {Edwine Nabahirwa and Wei Song and Minghua Zhang and Yi Fang and Zhou Ni},
  journal= {arXiv preprint arXiv:2509.08490},
  year   = {2025}
}

备注

72 Pages, 11 Figures