中文

基于脉冲神经网络的人工智能生成视频检测

计算机视觉与模式识别 2026-05-08 v1 人工智能

摘要

现代人工智能生成视频在单帧层面具备高度逼真度,剩余的时序证据成为检测的主要轴向。现有检测器通常以三种方式处理时序证据:将完整帧序列输入到通用时序骨干网络、将单一主导时序线索简化为固定视频级描述符,或通过检测度量将时序特征与真实视频统计信息进行比较。这些策略在跨生成器评估下表现显著下降,因为不同生成器的伪影类型和时间尺度各不相同。在caption配对的基准数据集GenVidBench上,我们发现两类尚未被 prior 检测器共同利用的签名:AI生成视频在像素层面 exhibits 更平滑的帧间时序残差,语义特征空间中轨迹更紧凑,表明两种层面上存在时序光滑性差距。我们进一步观察到,当原始视频输入到脉冲神经网络(SNN)时,伪造片段的放电主要集中在物体和运动边界,而真实片段则不同,这表明 SNN 对局部化于边缘的时序伪影作出响应。这些线索稀疏、非同步且集中在变化时刻,这使得 SNN 成为此任务的自然选择:其事件驱动、稀疏激活的动态与残差信号的结构方式吻合,与密集 ANN 骨干网络的做法不同。基于此观察,我们提出了 MAST 检测器,该检测器通过脉冲驱动的时序分支处理多通道时序残差,同时使用冻结的语义编码器以实现跨生成器的泛化。在 GenVideo 数据集上,MAST 在严格的跨生成器评估下,实现了 93.14% 的平均准确率,覆盖 10 个未见生成器,优于或相当于最强的 ANN 检测器,展示了 SNN 在 AI 生成视频检测中的实际应用前景。

关键词

引用

@article{arxiv.2605.05895,
  title  = {Detecting AI-Generated Videos with Spiking Neural Networks},
  author = {Minsuk Jang and Yujin Yang and Heeseon Kim and Minseok Son and Younghun Kim and Changick Kim},
  journal= {arXiv preprint arXiv:2605.05895},
  year   = {2026}
}