中文

水下场景中的 RGB-D 难辨目标计数

计算机视觉与模式识别 2025-01-14 v2

摘要

近年来,难辨/伪装场景理解在计算机视觉领域引起了大量研究关注。我们通过系统研究一项新挑战——难辨目标计数(IOC)进一步推进该领域前沿,其目标是计数与周围环境相融合的目标。由于缺乏合适的 IOC 数据集,我们提出大规模数据集 IOCfish5K,包含共计 5,637 张高分辨率图像与 659,024 个标注中心点。我们的数据集包含水下场景中大量难辨目标(主要为鱼),使标注过程更具挑战性。IOCfish5K 优于现有难辨场景数据集,因其规模更大、图像分辨率更高、标注更多且场景更密集。这些方面使其成为迄今最具挑战性的 IOC 数据集,支持该领域的进展。受益于深度估计基础模型的最新进展,我们使用 Depth Anything V2 模型生成伪标签,为 IOCfish5K 构建高质量深度图。IOCfish5K 的 RGB-D 版本命名为 IOCfish5K-D。为在 IOCfish5K 上基准测试,我们选取 14 种主流目标计数方法并仔细评估。对于多模态 IOCfish5K-D,我们评估了另外 4 种流行多模态计数方法。此外,我们提出 IOCFormer,一种结合密度与回归分支于统一框架并能有效应对伪装场景下目标计数的新强基线。我们还提出 IOCFormer-D 以有效利用深度模态辅助检测与计数隐藏于环境中的目标。实验表明,IOCFormer 与 IOCFormer-D 分别在 IOCfish5K 与 IOCfish5K-D 上取得最先进分数。

关键词

引用

@article{arxiv.2304.11677,
  title  = {RGB-D Indiscernible Object Counting in Underwater Scenes},
  author = {Guolei Sun and Xiaogang Cheng and Zhaochong An and Xiaokang Wang and Yun Liu and Deng-Ping Fan and Ming-Ming Cheng and Luc Van Gool},
  journal= {arXiv preprint arXiv:2304.11677},
  year   = {2025}
}

备注

Journal version. The resources are available at https://github.com/GuoleiSun/Indiscernible-Object-Counting