DeepSVU:基于统一物理世界正则化混合专家模型的深入安全导视频象理解
计算机视觉与模式识别
2026-02-23 v1 人工智能
摘要
在已有文献中,针对安全导视频象理解(SVU)的研究主要聚焦于检测和定位威胁(如枪击、抢劫)事件,而缺乏有效的生成和评估威胁原因的能力。为弥补这一差距,本文引入一种新的聊天范式SVU任务,即深入安全导视频象理解(DeepSVU),旨在不仅识别和定位威胁,还能归因并评估威胁段落的原因。进一步地,本文揭示了该任务中的两个关键挑战:1)如何有效地建模从粗到细的物理世界信息(如人类行为、物体交互和背景上下文)以提升DeepSVU任务;2)如何自适应地权衡这些因素。为解决这两个挑战,本文提出一种新的统一物理世界正则化混合专家模型(UPRM)方法。具体而言,UPRM包含两个关键组件:统一物理世界增强混合专家模型(UPE)模块和物理世界权衡正则化器(PTR),分别针对上述两个挑战。针对我们构建的DeepSVU指令数据集(即UCF-C指令和CUVA指令)进行的大量实验表明,UPRM在多个先进视频-LLM以及非VLM方法中均表现优异。这证明了从粗到细的物理世界信息对DeepSVU任务的重要性,并展示了UPRM在捕获此类信息方面的有效性。
引用
@article{arxiv.2602.18019,
title = {DeepSVU: Towards In-depth Security-oriented Video Understanding via Unified Physical-world Regularized MoE},
author = {Yujie Jin and Wenxin Zhang and Jingjing Wang and Guodong Zhou},
journal= {arXiv preprint arXiv:2602.18019},
year = {2026}
}