中文

利用视频基础模型简化交通异常检测

计算机视觉与模式识别 2025-09-03 v2

摘要

近期的 ego-centric 交通异常检测 (TAD) 方法常依赖复杂的多阶段或多表征融合架构,但是否真实必要尚不明确。近期的视觉感知研究表明,基础模型由于先进的预训练,允许简单且灵活的架构超越专门设计。因此,本文我们采用纯粹的 Video Vision Transformer (Video ViT) 的 encoder-only 方法,研究预训练如何实现强大的 TAD 性能。我们发现:(i) 先进的预训练使简单 encoder-only 模型能够匹配甚至超越专门的 SOTA TAD 方法,同时显著更高效;(ii)尽管弱监督和完全监督的预训练在标准基准上有优势,但我们发现对 TAD 来说效果较差。相反,自监督的Masked Video Modeling (MVM) 提供最强信号;(iii)对无异常样本的驾驶视频进行领域适应预训练 (DAPT) 能进一步提升下游性能。我们的发现凸显了预训练的重要性,表明可通过最小化架构复杂度构建有效、高效且可扩展的 TAD 模型。我们发布代码、领域适应编码器和微调模型以支持未来工作:https://github.com/tue-mps/simple-tad。

关键词

引用

@article{arxiv.2507.09338,
  title  = {Simplifying Traffic Anomaly Detection with Video Foundation Models},
  author = {Svetlana Orlova and Tommie Kerssies and Brunó B. Englert and Gijs Dubbelman},
  journal= {arXiv preprint arXiv:2507.09338},
  year   = {2025}
}

备注

ICCVW 2025 accepted. Code: https://github.com/tue-mps/simple-tad