中文

AVAR-Net:轻量级音视频异常识别框架及基准数据集

计算机视觉与模式识别 2025-11-12 v2

摘要

异常识别在监控、交通、医疗和公共安全等领域发挥着重要作用。然而,大多数现有方法仅依赖视觉数据,在遮挡、低照明和恶劣天气等困难条件下不可靠。此外,缺乏大规模同步音视频数据集也阻碍了多模态异常识别的进展。为此,本研究提出 AVAR-Net,一个面向实际环境的轻量级高效音视频异常识别框架。AVAR-Net 由四个主要模块组成:音频特征提取器、视频特征提取器、融合策略以及序列模式学习网络,用于建模跨模态关系进行异常识别。具体而言,Wav2Vec2 模型从原始音频中提取稳健的时序特征,而 MobileViT 捕获视频帧的局部和全局视觉表征。采用早期融合机制整合这些模态,随后使用多阶段时序卷积网络(MTCN)学习融合表示中的长程时序依赖,实现稳健的时空推理。同时引入新型视觉-音频异常识别(VAAR)数据集,作为中等规模基准,包含 3000 组实景视频及其同步音频,覆盖十个多样化的异常类别。实验评估显示,AVAR-Net 在 VAAR 数据集上实现 89.29% 的准确率,在 XD-Violence 数据集上实现 88.56% 的平均精度,相较于现有最新方法提升 2.8%。这些结果凸显了本框架在有效性、效率和泛化能力方面的优势,以及 VAAR 数据集在推动多模态异常识别研究方面的价值。

关键词

引用

@article{arxiv.2510.13630,
  title  = {AVAR-Net: A Lightweight Audio-Visual Anomaly Recognition Framework with a Benchmark Dataset},
  author = {Amjid Ali and Zulfiqar Ahmad Khan and Altaf Hussain and Muhammad Munsif and Adnan Hussain and Sung Wook Baik},
  journal= {arXiv preprint arXiv:2510.13630},
  year   = {2025}
}

备注

I would like to request the withdrawal of my paper . The reason for this request is that I am currently working on additional experiments and analyses, which will lead to updates in the results section. Once these updates are complete, I will resubmit the revised version. Thank you for your understanding