中文

基于视觉转换器的可解释异常性估计多模态融合

计算机视觉与模式识别 2025-12-11 v1 密码学与安全

摘要

异常性估计对于主动威胁检测和确保复杂环境中的公共安全至关重要。本工作引入一个大规模标注数据集USE50k,以及一个面向实时异常性分析的基于视觉的框架。USE50k数据集包含65,500张来自多样且不可控环境(如机场、铁路站、餐厅、公园等公共场所)的图像,涵盖了广泛的线索,包括武器、火灾、人群密度、异常面部表情和不寻常的身体姿势。基于该数据集,我们提出DeepUSEvision,一个轻量且模块化的系统,集成了三个关键组件,即基于增强YOLOv12架构的可疑物体检测器、用于面部表情和身体语言识别的双深度卷积神经网络(DCNN-I和DCNN-II)使用图像和地标特征,以及自适应融合多模态输出以产生可解释异常性评分的转换器-based鉴别器。大量实验表明,所提出的框架在准确性、鲁棒性和可解释性方面均优于最先进的方法。总体而言,USE50k数据集和DeepUSEvision框架为智能监视和安全关键应用中的实时风险评估建立了坚实且可扩展的基础。

关键词

引用

@article{arxiv.2512.09311,
  title  = {Transformer-Driven Multimodal Fusion for Explainable Suspiciousness Estimation in Visual Surveillance},
  author = {Kuldeep Singh Yadav and Lalan Kumar},
  journal= {arXiv preprint arXiv:2512.09311},
  year   = {2025}
}

备注

12 pages, 10 figures, IEEE Transaction on Image Processing