水下伪装目标跟踪遇上视觉-语言SAM2
计算机视觉与模式识别
2025-05-20 v5 人工智能
摘要
在过去十年中,视觉目标跟踪取得了显著进展,这在很大程度上归功于大规模数据集的可用性。然而,这些数据集主要集中在露天场景,很大程度上忽略了水下动物跟踪——尤其是伪装海洋动物带来的复杂挑战。为了弥补这一空白,我们向前迈进一步,提出了首个大规模多模态水下伪装目标跟踪数据集,即UW-COT220。基于所提出的数据集,这项工作首先在具有挑战性的水下环境中(如珊瑚礁)全面评估了当前先进的视觉目标跟踪方法,包括基于SAM和SAM2的跟踪器。我们的发现突显了SAM2相较于SAM的改进,展示了其在处理水下伪装目标复杂性方面增强的能力。此外,我们提出了一种基于视频基础模型SAM2的新型视觉-语言跟踪框架,称为VL-SAM2。大量实验结果表明,所提出的VL-SAM2在水下和露天目标跟踪数据集上均实现了SOTA性能。数据集和代码可在~{\color{magenta}{https://github.com/983632847/Awesome-Multimodal-Object-Tracking}}获取。
引用
@article{arxiv.2409.16902,
title = {Underwater Camouflaged Object Tracking Meets Vision-Language SAM2},
author = {Chunhui Zhang and Li Liu and Guanjie Huang and Zhipeng Zhang and Hao Wen and Xi Zhou and Shiming Ge and Yanfeng Wang},
journal= {arXiv preprint arXiv:2409.16902},
year = {2025}
}
备注
Accepted to CVPR 2025 Workshop on CV4Animals. https://github.com/983632847/Awesome-Multimodal-Object-Tracking