Syn-Att:基于 CNN 半监督未知多类集成的合成语音溯源
声音
2023-09-18 v1 计算机视觉与模式识别
音频与语音处理
摘要
随着深度学习在音频与语音处理领域带来的巨大技术进步,许多新颖的合成语音技术取得了令人难以置信的逼真效果。由于这些方法能生成逼真的伪造人声,它们可被用于人物模仿、假新闻传播、欺骗、媒体操纵等恶意行为。因此,检测合成或自然语音的能力已成为迫切需求。此外,能够判断哪类算法被用于生成某段合成语音,对于追踪肇事者具有极其重要的意义。本文提出一种新颖策略,将合成语音片段归属到用于合成它的生成器。所提出的检测器将音频转换为 log-mel 频谱图,使用 CNN 提取特征,并在五种已知与未知算法间进行分类,利用半监督与集成方法显著提升了鲁棒性与泛化能力。该检测器在两个评估数据集上得到验证,分别包含总计 18,000 条弱扰动(Eval 1)与 10,000 条强扰动(Eval 2)的合成语音。在 ICASSP 2022 的 IEEE SP Cup 挑战赛中,所提方法在 Eval 2 上准确率超越其他顶尖队伍 12–13%,在 Eval 1 上超越 1–2%。
引用
@article{arxiv.2309.08146,
title = {Syn-Att: Synthetic Speech Attribution via Semi-Supervised Unknown Multi-Class Ensemble of CNNs},
author = {Md Awsafur Rahman and Bishmoy Paul and Najibul Haque Sarker and Zaber Ibn Abdul Hakim and Shaikh Anowarul Fattah and Mohammad Saquib},
journal= {arXiv preprint arXiv:2309.08146},
year = {2023}
}
备注
Winning Solution of IEEE SP Cup at ICASSP 2022