情感与声学应一致:用于音频深度伪造检测的跨层级不一致性分析
声音
2026-01-21 v1
摘要
音频深度伪造检测 (ADD) 旨在从真实语音中检测出欺骗语音。大多数先前的研究假设声学或情感特征内部或之间的强相关性意味着真实性,因此专注于增强或测量这种相关性。然而,现有方法通常孤立地处理声学和情感特征,或依赖相关性指标,这忽略了它们之间微妙的去同步化,并平滑了突变的不连续性。为了解决这些问题,我们提出了 EAI-ADD,它将跨层级的情感-声学不一致性作为主要的检测信号。我们首先将情感和声学表示投影到一个可比较的空间中。然后,我们逐步将帧级和话语级情感特征与声学特征集成,以捕捉不同时间粒度上的跨层级情感-声学不一致性。在 ASVspoof 2019LA 和 2021LA 数据集上的实验结果表明,所提出的 EAI-ADD 优于基线方法,为音频反欺骗检测提供了一种更有效的解决方案。
引用
@article{arxiv.2601.13847,
title = {Emotion and Acoustics Should Agree: Cross-Level Inconsistency Analysis for Audio Deepfake Detection},
author = {Jinhua Zhang and Zhenqi Jia and Rui Liu},
journal= {arXiv preprint arXiv:2601.13847},
year = {2026}
}
备注
Accepted by ICASSP 2026