中文

MSVCOD:面向视频伪装目标检测的大规模多场景数据集

计算机视觉与模式识别 2025-06-02 v2

摘要

视频伪装目标检测 (VCOD) 是一项具有挑战性的任务,旨在识别视频中与背景无缝融合的伪装目标。视频的动态特性使得通过运动线索或不同视角来检测伪装目标成为可能。以往的 VCOD 数据集主要包含动物目标,将研究范围局限于野生动物场景。然而,VCOD 的应用超越了野生动物范畴,在安防、艺术和医疗领域具有重要意义。为解决这一问题,我们构建了一个新的大规模多领域 VCOD 数据集 MSVCOD。为实现高质量标注,我们设计了一种半自动迭代标注流程,在保持标注准确性的同时降低了成本。MSVCOD 是迄今为止最大的 VCOD 数据集,首次引入了包括人类、动物、医疗和车辆在内的多种目标类别,同时扩展了各种环境下的背景多样性。这种扩展的范围提高了 VCOD 任务在伪装目标检测中的实际适用性。伴随该数据集,我们提出了一种单流视频伪装目标检测模型,该模型无需额外的运动特征融合模块即可同时执行特征提取与信息融合。我们的框架在现有的 VCOD 动物数据集和提出的 MSVCOD 上均取得了 state-of-the-art 的结果。数据集和代码将公开发布。

关键词

引用

@article{arxiv.2502.13859,
  title  = {MSVCOD:A Large-Scale Multi-Scene Dataset for Video Camouflage Object Detection},
  author = {Shuyong Gao and Yu'ang Feng and Qishan Wang and Lingyi Hong and Xinyu Zhou and Liu Fei and Yan Wang and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2502.13859},
  year   = {2025}
}

备注

10 pages