中文

利用大型多模态模型进行音视频深度伪造检测:一项试点研究

声音 2026-03-02 v1 计算机视觉与模式识别

摘要

音视频深度伪造检测(AVD)日益重要,因为现代生成模型能够制造出令人信服的语音和视频。目前大多数多模态检测器都是小规模、任务特定模型:它们在精选测试上表现良好,但规模化差、跨域泛化能力弱。我们引入AV-LMMDetect,这是一种监督式微调(SFT)大型多模态模型,将AVD作为 prompted 是/否分类任务——“这段视频是真实的还是假的?”。基于Qwen 2.5 Omni构建,它联合分析音频和视觉流以进行深度伪造检测,并分为两个阶段进行训练:轻量级LoRA对齐 followed by 音视频编码器完整微调。在FakeAVCeleb和Mavos-DD数据集上,AV-LMMDetect匹配或超越了先前方法,并在Mavos-DD数据集上达成新的状态突破。

关键词

引用

@article{arxiv.2602.23393,
  title  = {Leveraging large multimodal models for audio-video deepfake detection: a pilot study},
  author = {Songjun Cao and Yuqi Li and Yunpeng Luo and Jianjun Yin and Long Ma},
  journal= {arXiv preprint arXiv:2602.23393},
  year   = {2026}
}

备注

5pages,ICASSP2026