面向能源效率的联邦学习视频暴力检测:轻量级 CNN 与视觉语言模型的互补角色
计算机视觉与模式识别
2025-11-11 v1 人工智能
机器学习
摘要
深度学习驱动的视频监控日益需要具备低计算和环境开销的隐私保护架构。虽然联邦学习保护了隐私,但部署大型视觉语言模型(VLM)会带来巨大的能源和可持续性挑战。本文在RWF-2000和RLVS数据集上进行非独立同分布(non-IID)分割下的联邦暴力检测比较实验,比较了三种策略:零样本推理使用预训练VLM、对LLaVA-NeXT-Video-7B进行LoRA-based微调、以及对65.8万参数3D CNN进行个性化联邦学习。所有方法在二分类暴力检测中均超过90%的准确率。3D CNN在约为联邦LoRA能源成本的一半(240 Wh vs. 570 Wh)的情况下,实现了更佳的校准效果(ROC AUC 92.59%),而VLM则提供了更丰富的多模态推理。基于语义相似性和类别排除的层次化类别分组,将VLM在UCF-Crime数据集上的多分类准确率从65.31%提升至81%。本文据此是首个针对联邦暴力检测 comparing LoRA微调的VLM和个性化CNN的比较性模拟研究,包含显式的能源和CO2e量化。我们的结果为混合部署策略提供指导,建议在常规推理时默认使用高效CNN,而在复杂情境推理时有选择性地启用VLM。
引用
@article{arxiv.2511.07171,
title = {Federated Learning for Video Violence Detection: Complementary Roles of Lightweight CNNs and Vision-Language Models for Energy-Efficient Use},
author = {Sébastien Thuau and Siba Haidar and Rachid Chelouah},
journal= {arXiv preprint arXiv:2511.07171},
year = {2025}
}
备注
5 pages, 3 figures, ICTAI 2025