基于强化学习的视觉Transformer混合架构用于视频暴力识别
计算机视觉与模式识别
2023-10-06 v1
摘要
基于深度学习的视频暴力识别关注准确且可扩展的人类暴力行为识别。当前,大多数最先进的视频暴力识别研究使用基于 CNN 的模型来表征与分类视频。然而,近期研究表明,预训练的 transformer 在各种视频分析基准上比基于 CNN 的模型更准确。但这些模型尚未在视频暴力识别中得到充分评估。本文引入了一种新颖的基于 transformer 的专家混合(MoE)视频暴力识别系统。通过智能组合大型视觉 transformer 与高效 transformer 架构,所提系统不仅利用了视觉 transformer 架构的优势,还降低了使用大型视觉 transformer 的成本。所提架构通过基于强化学习的路由器在主动降低计算成本的同时最大化暴力识别系统的准确率。实证结果显示,所提 MoE 架构在 RWF 数据集上取得 92.4% 的准确率,优于基于 CNN 的模型。
引用
@article{arxiv.2310.03108,
title = {Reinforcement Learning-based Mixture of Vision Transformers for Video Violence Recognition},
author = {Hamid Mohammadi and Ehsan Nazerfard and Tahereh Firoozi},
journal= {arXiv preprint arXiv:2310.03108},
year = {2023}
}