中文

MIST:面向视频异常检测的多示例自训练框架

计算机视觉与模式识别 2021-04-06 v1

摘要

弱监督视频异常检测(WS-VAD)旨在基于判别性表示区分异常事件与正常事件。现有多数工作受限于视频表示不足。本文提出一种多示例自训练框架(MIST),仅利用视频级标注即可高效精炼任务特定的判别性表示。具体而言,MIST由两部分组成:1)多示例伪标签生成器,采用稀疏连续采样策略生成更可靠的片段级伪标签;2)自引导注意力增强特征编码器,旨在提取任务特定表示的同时自动聚焦于帧中的异常区域。此外,我们采用自训练方案优化上述两个组件,最终获得任务特定的特征编码器。在两个公开数据集上的大量实验证明了本方法的有效性,其性能与现有监督及弱监督方法相当甚至更优,特别是在ShanghaiTech上取得94.83%的帧级AUC。

关键词

引用

@article{arxiv.2104.01633,
  title  = {MIST: Multiple Instance Self-Training Framework for Video Anomaly Detection},
  author = {Jia-Chang Feng and Fa-Ting Hong and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2104.01633},
  year   = {2021}
}

备注

Accepted by CVPR 2021