自我暴露:一种基于单声道到立体声转换的新型音频深度伪造检测模型
声音
2023-05-29 v1 人工智能
计算与语言
摘要
音频深度伪造检测(ADD)旨在检测由文本到语音(TTS)、语音转换(VC)和重放等生成的伪造音频,是一个新兴课题。传统上我们将单声道信号作为输入,并关注鲁棒的特征提取与有效的分类器设计。然而,音频信号中的双通道立体声信息也包含用于深度伪造的重要线索,这在先前工作中尚未被研究。本文提出一种新颖的 ADD 模型,称为 M2S-ADD,试图在单声道到立体声的转换过程中发现音频真实性线索。我们首先使用预训练的立体声合成器将单声道投影为立体声信号,然后采用双分支神经架构分别处理左、右声道信号。通过这种方式,我们有效揭示了伪造音频中的伪影,从而提升了 ADD 性能。在 ASVspoof2019 数据库上的实验表明,M2S-ADD 优于所有以单声道为输入的基线方法。我们在 \url{https://github.com/AI-S2-Lab/M2S-ADD} 发布了源代码。
引用
@article{arxiv.2305.16353,
title = {Betray Oneself: A Novel Audio DeepFake Detection Model via Mono-to-Stereo Conversion},
author = {Rui Liu and Jinhua Zhang and Guanglai Gao and Haizhou Li},
journal= {arXiv preprint arXiv:2305.16353},
year = {2023}
}
备注
To appear at InterSpeech2023