音素级特征差异:检测复杂语音深度伪造的关键
声音
2024-12-18 v1 人工智能
音频与语音处理
摘要
文本到语音和语音转换技术的最新进展使得创建高度逼真的合成语音成为可能。虽然这些创新带来了许多实际益处,但一旦被恶意滥用,也会造成严重的安全挑战。因此,迫切需要检测这些合成语音信号。音素特征为深度伪造检测提供了强大的语音表示。然而,以往基于音素的检测方法通常只关注特定音素,忽略了整个音素序列中的时间不一致性。在本文中,我们开发了一种通过识别音素级语音特征不一致性来检测语音深度伪造的新机制。我们设计了一种自适应音素池化技术,从帧级语音数据中提取特定于样本的音素级特征。通过将该技术应用于预训练音频模型在先前未见的深度伪造数据集上提取的特征,我们证明与真实语音相比,深度伪造样本通常表现出音素级不一致性。为了进一步提高检测精度,我们提出了一种深度伪造检测器,该检测器使用图注意力网络对音素级特征的时间依赖性进行建模。此外,我们引入了一种随机音素替换增强技术,以在训练期间增加特征多样性。在四个基准数据集上的大量实验表明,我们的方法优于现有的最先进检测方法。
引用
@article{arxiv.2412.12619,
title = {Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes},
author = {Kuiyuan Zhang and Zhongyun Hua and Rushi Lan and Yushu Zhang and Yifang Guo},
journal= {arXiv preprint arXiv:2412.12619},
year = {2024}
}