中文

基于层次Transformer的半监督视频中时间分治异常动作定位

计算机视觉与模式识别 2024-08-27 v1

摘要

异常动作检测和定位在安全和高级监控系统中起着至关重要的作用。然而,由于监控视频数量巨大,该任务的大部分可用数据是未标记或半标记的,即视频类别已知,但异常事件的位置未知。在这项工作中,我们针对半监督视频中的异常定位。虽然解决此任务的主流方向集中在片段级多实例学习和伪标签生成上,但我们旨在探索一个有前景但尚未实现的方向,即通过学习视频内的时间关系来定位异常事件。为此,我们提出了一种层次Transformer模型,该模型设计用于通过沿时间轴的分治策略评估异常视频中观察动作的重要性。我们的方法将父视频层次分割为多个时间子实例,并衡量子节点在分类父视频异常性方面的影响。我们在两个著名的异常检测数据集UCF-crime和ShanghaiTech上评估了我们的模型,证明了其解释视频内观察动作并定位异常动作的能力。我们提出的方法优于以往依赖片段级多实例学习的方法,同时与更新的基于伪标签的方法相比达到了有竞争力的性能。

关键词

引用

@article{arxiv.2408.13643,
  title  = {Temporal Divide-and-Conquer Anomaly Actions Localization in Semi-Supervised Videos with Hierarchical Transformer},
  author = {Nada Osman and Marwan Torki},
  journal= {arXiv preprint arXiv:2408.13643},
  year   = {2024}
}

备注

Accepted at the 27th International Conference on Pattern Recognition (ICPR-2024)