面向视频伪装目标检测的 YUV20K:基于复杂度驱动的基准数据集与轨迹感知对齐模型
计算机视觉与模式识别
2026-04-14 v1 数据库
摘要
视频伪装目标检测(VCOD)目前受限于挑战性基准数据稀缺以及模型对异常运动动态的鲁棒性不足。现有方法在应对由复杂运动场景引起的运动引起的外观不稳定性和时序特征错位方面常常感到挑战。为缓解数据瓶颈,我们提出YUV20K,一个像素级别的注释复杂度驱动型VCOD基准数据集。该数据集涵盖24,295个标注帧,覆盖91个场景和47种物种,特别针对大位移运动、摄像机运动等4类挑战性场景进行设计。方法层面,我们提出一种新型框架,包含两个关键模块:运动特征稳定(MFS)和轨迹感知对齐(TAA)。MFS模块利用帧无关的语义基元来稳定特征,而TAA模块则利用轨迹引导的可变形采样以确保精确的时序对齐。大量实验表明,我们的方法在现有数据集上显著优于最先进的竞争者,并在具有挑战性的YUV20K数据集上建立了新的基线。值得注意的是,我们的框架在应对复杂时空场景时展现出卓越的跨域泛化和鲁棒性。我们的代码和数据集将提供于https://github.com/K1NSA/YUV20K
引用
@article{arxiv.2604.09985,
title = {YUV20K: A Complexity-Driven Benchmark and Trajectory-Aware Alignment Model for Video Camouflaged Object Detection},
author = {Yiyu Liu and Shuo Ye and Chao Hao and Zitong Yu},
journal= {arXiv preprint arXiv:2604.09985},
year = {2026}
}