CoLoRSMamba:用于有监督多模态暴力检测的条件 LoRA 引导 Mamba
计算机视觉与模式识别
2026-04-07 v1 人工智能
机器学习
声音
摘要
暴力检测受益于音频,但现实世界的声音场景可能充满噪声或与可见场景关联微弱。我们提出了 CoLoRSMamba,这是一种定向的视频到音频多模态架构,通过 CLS 引导的条件 LoRA 将 VideoMamba 和 AudioMamba 耦合起来。在每一层,VideoMamba 的 CLS 令牌产生一个通道级调制向量和一个稳定门,用于调整负责选择性状态空间参数(Delta, B, C)的 AudioMamba 投影,包括步长路径,从而在无需令牌级交叉注意力的情况下产生场景感知的音频动态。训练将二元分类与对称的 AV-InfoNCE 目标相结合,该目标对齐片段级的音频和视频嵌入。为了支持公平的多模态评估,我们根据时间标注从 NTU-CCTV 和 DVD 数据集中筛选出音频过滤的片段级子集,仅保留有可用音频的片段。在这些子集上,CoLoRSMamba 优于代表性的纯音频、纯视频和多模态基线,在 NTU-CCTV 上达到 88.63% 的准确率 / 86.24% 的 F1-V 分数,在 DVD 上达到 75.77% 的准确率 / 72.94% 的 F1-V 分数。它还提供了有利的精度-效率权衡,以更少的参数量和 FLOPs 超越了几个更大的模型。
引用
@article{arxiv.2604.03329,
title = {CoLoRSMamba: Conditional LoRA-Steered Mamba for Supervised Multimodal Violence Detection},
author = {Damith Chamalke Senadeera and Dimitrios Kollias and Gregory Slabaugh},
journal= {arXiv preprint arXiv:2604.03329},
year = {2026}
}