中文

面向 AI 生成视频检测与定位的多模态伪造表征学习

计算机视觉与模式识别 2026-05-11 v1

摘要

近期生成式 AI 的进展使大规模视频创建民主化。包括跨越视觉和音频通道的部分操纵剪辑的 AI 生成视频,构成了语义扭曲和滥用的日益加剧的风险,这就催化了可靠检测工具的需求。目前大多数 AI 生成视频检测器受限于单模态或部分模态的数据建模,以及缺乏细粒度时序伪造定位。为此,本文的主要创新性贡献引入了一种核心架构,联合集成了 LMM 语义分支、时空(ST)视觉分支和多尺度部分伪造(PS)音频分支。这种多模态方法实现了对部分操纵 AI 生成视频伪造的同步检测和细粒度时序定位。大量实验表明,该方法超越了现有领先方法。

关键词

引用

@article{arxiv.2605.07232,
  title  = {Towards multi-modal forgery representation learning for AI-generated video detection and localization},
  author = {Dat Le and Khoa Nguyen and Xin Wang and Shu Hu},
  journal= {arXiv preprint arXiv:2605.07232},
  year   = {2026}
}