中文

PhonemeFake:基于语言驱动的分段操纵与自适应双层检测重塑深度伪造逼真度

计算机视觉与模式识别 2025-10-09 v1 人工智能 计算与语言

摘要

深度伪造(DF)攻击正日益增长,作为生成模型变得越来越先进。然而,我们的研究发现,现有 DF 数据集未能欺骗人类感知,与实际 DF 攻击不同,后者影响公共话语。这凸显了需要更真实 DF 攻击向量的需求。我们引入PhonemeFake(PF),一种利用语言推理操纵关键语音段落的 DF 攻击,显著降低人类感知最高可达42%,基准准确率降低最高可达94%。我们在 HuggingFace 上发布了易于使用的 PF 数据集,并开源双层 DF 残检测模型,自适应优先处理被操纵区域。我们的广泛实验在三个已知 DF 数据集上显示,我们的检测模型在 EER 上降低91%,实现最高可达90%的加速,几乎没有额外计算开销,定位精确度超越现有模型,作为可扩展解决方案。

关键词

引用

@article{arxiv.2506.22783,
  title  = {PhonemeFake: Redefining Deepfake Realism with Language-Driven Segmental Manipulation and Adaptive Bilevel Detection},
  author = {Oguzhan Baser and Ahmet Ege Tanriverdi and Sriram Vishwanath and Sandeep P. Chinchali},
  journal= {arXiv preprint arXiv:2506.22783},
  year   = {2025}
}

备注

5 pages, 3 figures, Published at Proceedings of Interspeech 2025, for the dataset see https://huggingface.co/datasets/phonemefake/PhonemeFakeV2, for the code see https://github.com/UTAustin-SwarmLab/ PhonemeFake