GMM-ResNet2:用于合成语音检测的组 ResNet 网络集成
声音
2024-07-03 v1 音频与语音处理
摘要
深度学习模型在说话人识别和欺骗语音检测中广泛应用。我们提出了 GMM-ResNet2 用于合成语音检测。与之前的 GMM-ResNet 模型相比,GMM-ResNet2 包含四项改进。首先,不同阶数的 GMM 具有不同的能力来形成对特征分布的平滑近似,多个 GMM 用于提取多尺度 Log 高斯概率特征。其次,采用分组技术以减少参数数量和训练时间,同时提高分类准确度,通过暴露组基数来实现。最终得分通过对所有组分类器输出的平均方法进行集成获得。第三,残差块通过包含一个激活函数和一个批归一化层进行改进。第四,提出一种面向集成的损失函数,用于整合所有集成成员的独立损失函数。在 ASVspoof 2019 LA 任务中,GMM-ResNet2 实现了最低 t-DCF 为 0.0227 和 EER 为 0.79\%。在 ASVspoof 2021 LA 任务中,GMM-ResNet2 实现了最低 t-DCF 为 0.2362 和 EER 为 2.19\%,相较于 LFCC-LCNN 基线实现了相对降低 31.4\% 和 76.3\%。
引用
@article{arxiv.2407.02170,
title = {GMM-ResNet2: Ensemble of Group ResNet Networks for Synthetic Speech Detection},
author = {Zhenchun Lei and Hui Yan and Changhong Liu and Yong Zhou and Minglei Ma},
journal= {arXiv preprint arXiv:2407.02170},
year = {2024}
}