中文

基于 F0 信息与实虚部谱图特征组合的音频深度伪造检测

声音 2023-03-03 v1 机器学习 音频与语音处理

摘要

近来,开创性研究工作提出了大量用于音频深度伪造检测的声学特征(对数功率谱图、线性频率倒谱系数、常数 Q 倒谱系数等),取得了良好性能,并表明不同子带对音频深度伪造检测的贡献不同。然而,这缺乏对子带中具体信息的解释,且这些特征也丢失了相位等信息。受合成语音机制启发,基频(F0)信息被用于提升合成语音质量,而合成语音的 F0 仍过于平均,与真实语音差异显著。期望 F0 可作为区分真实与伪造语音的重要信息,但由于 F0 分布不规则,该信息无法直接利用。为此,选取包含大部分 F0 的频带作为输入特征。同时,为充分利用相位与全带信息,我们还提出使用实部与虚部谱图特征作为互补输入特征,并分别对不相交子带建模。最后,融合 F0、实部与虚部谱图特征的结果。在 ASVspoof 2019 LA 数据集上的实验结果表明,我们所提系统对音频深度伪造检测任务非常有效,取得了 0.43% 的等错误率(EER),优于几乎所有系统。

关键词

引用

@article{arxiv.2208.01214,
  title  = {Audio Deepfake Detection Based on a Combination of F0 Information and Real Plus Imaginary Spectrogram Features},
  author = {Jun Xue and Cunhang Fan and Zhao Lv and Jianhua Tao and Jiangyan Yi and Chengshi Zheng and Zhengqi Wen and Minmin Yuan and Shegang Shao},
  journal= {arXiv preprint arXiv:2208.01214},
  year   = {2023}
}