中文

Emoanti:基于情感引导表示的音频反深度伪造

声音 2025-09-16 v1

摘要

音频深度伪造技术日益成熟,缺乏有效检测方法将致命。虽然大多数检测系统主要依赖低级声学特征或预训练语音表示,但常常忽视高阶情感线索,这些线索可为检测提供补充且潜在具有反深度伪造信息,从而提升泛化能力。本文提出一种新型音频反深度伪造系统(EmoAnti),其利用情感特征(EmoAnti),通过在情感识别任务上微调的预训练 Wav2Vec2(W2V2)模型提取情感引导的表示,然后设计基于卷积层与残差连接的专用特征提取器,以有效捕获来自变换层输出的情感特征。实验结果表明,我们的 proposed 架构在ASVspoof2019LA和ASVspoof2021LA基准测试上实现了最先进的性能,并在ASVspoof2021DF数据集上显示出强大的泛化能力。我们的方法的代码已在Anonymous GitHub上提供。

关键词

引用

@article{arxiv.2509.10781,
  title  = {Emoanti: audio anti-deepfake with refined emotion-guided representations},
  author = {Xiaokang Li and Yicheng Gong and Dinghao Zou and Xin Cao and Sunbowen Lee},
  journal= {arXiv preprint arXiv:2509.10781},
  year   = {2025}
}