CMTA:利用跨模态时序人工痕迹进行通用 AI 生成视频检测
计算机视觉与模式识别
2026-05-04 v1 多媒体
图像与视频处理
摘要
先进的 AI 视频合成技术的普及正带来前所未有的挑战,考验数字视频的真实性。现有的 AI 生成视频 (AI-generated video, AIGV) 检测方法主要关注单模态或时空人工痕迹,但忽略了视觉-文本跨模态空间中丰富的线索,尤其是语义对齐的时间稳定性。在本工作中,我们识别出 AIGV 中 distinctive 的指纹,称为跨模态时序人工痕迹 (cross-modal temporal artifact, CMTA)。不同于真实视频在语义变化下自然的跨模态对齐时间波动,AIGV 显示出受给定输入提示支配的异常稳定的语义轨迹。为弥合这一差距,我们提出了 CMTA 框架,一种跨模态检测方法,通过联合跨模态嵌入和多层次时序建模捕获这些独特的时序人工痕迹。具体而言,CMTA 利用 BLIP 生成帧级图像描述,并利用 CLIP 提取对应的视觉-文本表示。随后设计粗粒度时序建模分支以 GRU 捕获跨模态对齐的时序波动,同时构建细粒度分支通过 Transformer 编码器捕获集成视觉-文本特征的帧间复杂变异。广泛实验在 40 个数据集子集上进行,涵盖 GenVideo、EvalCrafter、VideoPhy 和 VidProM 四大型数据集,表明我们的方法在设置新 SOTA 的同时,展现出卓越的跨生成器泛化能力。CMTA 的代码和模型将在 https://github.com/hwang-cs-ime/CMTA 发布。
引用
@article{arxiv.2605.00630,
title = {CMTA: Leveraging Cross-Modal Temporal Artifacts for Generalizable AI-Generated Video Detection},
author = {Hang Wang and Chao Shen and Chenhao Lin and Minghui Yang and Lei Zhang and Cong Wang},
journal= {arXiv preprint arXiv:2605.00630},
year = {2026}
}
备注
15 pages, 4 figures