用于说话人确认的 ResNeXt 与 Res2Net 结构
音频与语音处理
2020-12-01 v2 声音
摘要
基于 ResNet 的架构已被广泛采用以提取文本无关说话人确认系统的说话人嵌入。通过将残差连接引入 CNN 并标准化残差块,ResNet 结构能够训练深层网络以实现极具竞争力的识别性能。然而,当输入特征空间变得更复杂时,单纯增加 ResNet 网络的深度和宽度可能无法充分发挥其性能潜力。本文中,我们提出 ResNet 架构的两种扩展——ResNeXt 与 Res2Net,用于说话人确认。ResNeXt 与 Res2Net 最初为图像识别而提出,其在深度和宽度之外引入了另外两个维度——基数(cardinality)与尺度(scale),以提升模型的表示能力。通过增大尺度维度,Res2Net 模型能够以不同粒度表示多尺度特征,这尤其有助于短语音的说话人确认。我们在三项说话人确认任务上评估了所提出的系统。在 VoxCeleb 测试集上的实验表明,ResNeXt 与 Res2Net 能显著优于传统 ResNet 模型。Res2Net 模型通过将 EER 相对降低 18.5% 取得了更优性能。在另外两个条件失配的内部测试集上的实验进一步证实了 ResNeXt 与 Res2Net 架构对噪声环境与片段长度变化的泛化能力。
引用
@article{arxiv.2007.02480,
title = {ResNeXt and Res2Net Structures for Speaker Verification},
author = {Tianyan Zhou and Yong Zhao and Jian Wu},
journal= {arXiv preprint arXiv:2007.02480},
year = {2020}
}
备注
to be published in IEEE Spoken Language Technology Workshop(SLT) 2021