中文

MUOT_3M:300 万帧多模态 underwater 基准及 MUTrack 跟踪方法

计算机视觉与模式识别 2026-02-23 v1

摘要

水下目标跟踪(UOT)对于高效的海洋机器人、大规模生态监测和海洋探索至关重要,但由于大规模、多模态和多样化数据稀缺,进展受到阻碍。现有基准数据集规模较小且仅为 RGB 模式,限制了在严重色彩失真、浑浊和低可见度条件下的鲁棒性。我们引入 MUOT_3M,首个伪多模态 UOT 基准,包含 300 万帧、3030 个视频(27.8 小时),标注了 32 个跟踪属性、677 个细粒度类别,并同步提供 RGB、估计增强 RGB、估计深度和语言四种模态,经海洋生物学家验证。基于 MUOT_3M,我们提出 MUTrack,一种基于 SAM 的多模态到单模态跟踪器,具有视觉几何对齐、视觉语言融合和四级知识蒸馏,将多模态知识传递给单模态学生模型。广泛的评估表明,MUTrack 在五个 UOT 基准上实现了最高可达 8.40% 更高的 AUC 和 7.80% 更高的精度,同时以 24 FPS 的速度运行。MUOT_3M 和 MUTrack 为可扩展的、经过多模态训练但在实际中可部署的水下跟踪奠定了新基础。

关键词

引用

@article{arxiv.2602.18006,
  title  = {MUOT_3M: A 3 Million Frame Multimodal Underwater Benchmark and the MUTrack Tracking Method},
  author = {Ahsan Baidar Bakht and Mohamad Alansari and Muhayy Ud Din and Muzammal Naseer and Sajid Javed and Irfan Hussain and Jiri Matas and Arif Mahmood},
  journal= {arXiv preprint arXiv:2602.18006},
  year   = {2026}
}