中文

参考感知的音视频深度伪造检测

计算机视觉与模式识别 2026-03-16 v2 多媒体

摘要

由高级生成模型生成的深度伪造正快速构成严重威胁,而现有的音视频深度伪造检测方法在面对未见的操纵方法时难以获得良好泛化。为此,我们提出了一种新颖的参考感知音视频深度伪造检测方法,称为 Referee,通过捕获细粒度的身份不一致性。不同于过度依赖于暂时性时空瑕疵的现有方法,Referee 采用身份瓶颈和匹配模块,以单个 one-shot 示例作为生物识别锚点,来建模说话人特定线索的关系一致性。在 FakeAVCeleb、FaceForensics++ 和 KoDF 上进行的大量实验表明,Referee 在跨数据集和跨语言评估协议上实现了最先进的效果,包括在 KoDF 上的 99.4% AUC。这些结果突显了显式关联参考基准生物特征先验是实现通用可靠音视频法医学的关键前沿。代码已公开于 https://github.com/ewha-mmai/referee。

关键词

引用

@article{arxiv.2510.27475,
  title  = {Referee: Reference-aware Audiovisual Deepfake Detection},
  author = {Hyemin Boo and Eunsang Lee and Jiyoung Lee},
  journal= {arXiv preprint arXiv:2510.27475},
  year   = {2026}
}

备注

In Progress