中文

基于音视频一致性的零样文本人造视频检测

声音 2024-06-13 v1 多媒体 音频与语音处理

摘要

近期研究倾向于将人造视频检测视为一类检测任务,基于假设 genuine 数据的音视频模态一致性显著高于 fake 数据的一致性。该方法仅依赖 genuine 音视频数据,无需 forged 数据,因而被称为“零样”检测范式。本文引入一种基于音视频内容一致性的新型零样检测方法。通过采用预训练的语音识别(ASR)和视频语义识别(VSR)模型,我们分别识别音频和视频内容序列。随后计算两者之间的编辑距离,以评估所述视频是否为 genuine。实验结果表明,与基于语义一致性和时间一致性的两种主流方法相比,我们的方法在 various deepfake 技术上实现更好的通用性,对音视频扰动展现出强大的鲁棒性。最后,通过简单整合这三种系统的决策得分,可实现最佳性能。

关键词

引用

@article{arxiv.2406.07854,
  title  = {Zero-Shot Fake Video Detection by Audio-Visual Consistency},
  author = {Xiaolou Li and Zehua Liu and Chen Chen and Lantian Li and Li Guo and Dong Wang},
  journal= {arXiv preprint arXiv:2406.07854},
  year   = {2024}
}

备注

to be published in INTERSPEECH 2024