中文

情感桥梁:通过情感约束增强深度伪造检测的同时保留语音表征

声音 2026-02-26 v2

摘要

语音深度伪造检测(DFD)受益于多样化的声学与语义语音表征,其中许多编码了有价值的语音信息且训练代价高昂。现有方法通常通过微调表征或在冻结特征上应用后验分类来增强 DFD,这限制了在不扭曲原始语义的情况下改善判别性 DF 线索的控制。我们发现情感编码于多种语音特征中,并与 DFD 相关。因此,我们引入了一个统一的、特征无关的、非破坏性的训练框架,利用情感作为桥梁约束来引导语音特征朝向 DFD,将情感识别视为表征对齐目标而非辅助任务,同时保留原始语义信息。在 FakeOrReal 和 IntheWild 上的实验分别显示准确率提升高达 6% 和 2%,并伴随等错误率的相应降低。代码见补充材料。

关键词

引用

@article{arxiv.2512.11241,
  title  = {The Affective Bridge: Preserving Speech Representations while Enhancing Deepfake Detection vian emotional Constraints},
  author = {Yupei Li and Chenyang Lyu and Longyue Wang and Weihua Luo and Kaifu Zhang and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2512.11241},
  year   = {2026}
}

备注

Submitted to interspeech 2026 for review