超越欧几里得:面向弱监督视频暴力检测的双空间表示学习
计算机视觉与模式识别
2024-10-01 v1
摘要
尽管众多视频暴力检测(VVD)方法专注于欧几里得空间中的表示学习,但它们难以学习到足够具有判别力的特征,导致在识别与暴力事件视觉上相似的正常事件(即模糊暴力)时存在弱点。相比之下,双曲表示学习以其建模事件间层次和复杂关系的能力而闻名,有望放大视觉上相似事件之间的判别能力。受此启发,我们为弱监督 VVD 开发了一种新颖的双空间表示学习(DSRL)方法,以利用欧几里得和双曲几何的优势,捕获事件的视觉特征,同时探索事件之间的内在关系,从而增强特征的判别能力。DSRL 采用一种新颖的信息聚合策略,在双曲空间中逐步学习事件上下文,该策略通过受双曲 Dirichlet 能量约束的层敏感双曲关联度来选择聚合节点。此外,DSRL 尝试打破不同空间之间的信息孤岛,利用跨空间注意力促进欧几里得空间和双曲空间之间的信息交互,从而为最终的暴力检测捕获更好的判别特征。综合实验证明了我们提出的 DSRL 的有效性。
引用
@article{arxiv.2409.19252,
title = {Beyond Euclidean: Dual-Space Representation Learning for Weakly Supervised Video Violence Detection},
author = {Jiaxu Leng and Zhanjie Wu and Mingpi Tan and Yiran Liu and Ji Gan and Haosheng Chen and Xinbo Gao},
journal= {arXiv preprint arXiv:2409.19252},
year = {2024}
}
备注
Accepted by NeurIPS 2024