基于三维骨架点云上人机交互学习改进视频暴力识别
计算机视觉与模式识别
2023-08-29 v1
摘要
深度学习已被证明在视频动作识别中非常有效。视频暴力识别试图在更复杂的场景中学习人类的多动态行为。在这项工作中,我们从骨架点的新视角开发了一种视频暴力识别方法。与以往工作不同,我们首先从视频中提取的人体骨架序列构造三维骨架点云,然后在这些三维骨架点云上进行交互学习。具体而言,我们提出两类骨架点交互学习(SPIL)策略:(i) 局部-SPIL:通过在局部区域点之间构建特定的权重分布策略,局部-SPIL旨在基于其特征和时空位置信息选择性地聚焦于其中最相关的部分。为捕获多样的关系信息,设计了一种多头机制,从独立头中聚合不同特征以联合处理点之间的不同类型关系。(ii) 全局-SPIL:为更好地学习和精炼无序且非结构化的骨架点特征,全局-SPIL采用直接在采样点上操作的自注意力层,这有助于使输出更具置换不变性并适于我们的任务。大量实验结果验证了方法的有效性,并表明我们的模型优于现有网络,在视频暴力数据集上取得了新的SOTA性能。
引用
@article{arxiv.2308.13866,
title = {Improving Video Violence Recognition with Human Interaction Learning on 3D Skeleton Point Clouds},
author = {Yukun Su and Guosheng Lin and Qingyao Wu},
journal= {arXiv preprint arXiv:2308.13866},
year = {2023}
}