检测、检索与解释统一:基于知识图谱和图注意力网络的暴力检测系统
计算机视觉与模式识别
2025-02-07 v3 人工智能
摘要
最近,使用统一多模态模型开发的暴力检测系统取得了显著成功并引起了广泛关注。然而,大多数此类系统面临两个关键挑战:作为黑箱模型缺乏可解释性,以及功能有限,仅提供分类或检索能力。为了解决这些挑战,本文提出了一种新颖的可解释暴力检测系统,称为三合一(TIO)系统。TIO系统集成了知识图谱(KG)和图注意力网络(GAT),提供三个核心功能:检测、检索和解释。具体来说,系统处理每个视频帧以及由大语言模型(LLM)为包含潜在暴力行为的视频生成的文本描述。它采用ImageBind生成高维嵌入以构建知识图谱,使用GAT进行推理,并应用轻量级时间序列模块提取视频嵌入特征。最后一步连接分类器和检索器以实现多功能输出。KG的可解释性使系统能够验证每个输出背后的推理过程。此外,本文还介绍了几种轻量级方法以减少TIO系统的资源消耗并提高其效率。在XD-Violence和UCF-Crime数据集上进行的大量实验验证了所提系统的有效性。一项案例研究进一步揭示了一个有趣的现象:随着旁观者数量的增加,暴力行为的发生率趋于下降。
引用
@article{arxiv.2501.06224,
title = {Detection, Retrieval, and Explanation Unified: A Violence Detection System Based on Knowledge Graphs and GAT},
author = {Wen-Dong Jiang and Chih-Yung Chang and Diptendu Sinha Roy},
journal= {arXiv preprint arXiv:2501.06224},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication