SpecSem-Net:集成光谱与语义特征的鲁棒AI生成视频检测框架
计算机视觉与模式识别
2026-05-19 v1
摘要
近期商业化视频生成模型(如Sora、Veo)展现的惊人视觉保真度,使得鲁棒的AI生成视频检测日益关键,以防止合成内容与真实视频难以区分并被用于散布虚假信息。然而,现有检测器常因过度依赖日益逼真的语义特征而失败,忽略了细微的光谱痕迹。本文提出SpecSem-Net,首个为高保真AI生成视频检测引入语义引导的光谱去噪机制。具体而言,我们设计光谱模块通过傅里叶变换基于滤波提取高频特征。为减少因光谱噪声导致的误判,我们采用门控融合机制自适应融合语义上下文,有效缓解光谱噪声。此外,为评估最新顶级生成模型的检测性能,我们构建了包含5个SOTA商业生成器的综合基准。广泛实验表明,SpecSem-Net在本基准和公开数据集上分别实现了87.25%和95.59%的准确率,超越现有方法。
引用
@article{arxiv.2605.17311,
title = {SpecSem-Net: Integrating Spectral and Semantic Features for Robust AI-generated Video Detection},
author = {Zixi Wei and Huixuaun Zhang and Xiaojun Wan},
journal= {arXiv preprint arXiv:2605.17311},
year = {2026}
}