基于 F0 子带与空间重构局部注意力 Res2Net 的伪造语音检测
声音
2024-07-09 v2 音频与语音处理
摘要
真实语音的节奏通常难以复制,导致合成语音的基频(F0)与真实语音显著不同。可以预期 F0 特征包含用于伪造语音检测(FSD)任务的判别信息。本文提出一种新颖的 F0 子带用于 FSD。此外,为有效建模 F0 子带以提升 FSD 性能,提出空间重构局部注意力 Res2Net(SR-LA Res2Net)。具体而言,以 Res2Net 作为骨干网络获取多尺度信息,并增强空间重构机制,以避免通道组不断叠加时丢失重要信息。此外,设计局部注意力使模型聚焦于 F0 子带的局部信息。在 ASVspoof 2019 LA 数据集上的实验结果表明,我们所提方法取得了 0.47% 的等错误率(EER)和 0.0159 的最小串联检测代价函数(min t-DCF),在所有单系统中达到了最先进的性能。
引用
@article{arxiv.2308.09944,
title = {Spatial Reconstructed Local Attention Res2Net with F0 Subband for Fake Speech Detection},
author = {Cunhang Fan and Jun Xue and Jianhua Tao and Jiangyan Yi and Chenglong Wang and Chengshi Zheng and Zhao Lv},
journal= {arXiv preprint arXiv:2308.09944},
year = {2024}
}
备注
Accept by Neural Networks