Golden Gemini 即你所需:寻找声纹验证的最佳配置点
音频与语音处理
2024-04-25 v3 声音
摘要
先前的研究证明了残差神经网络(ResNet)在声纹验证中的出色性能。ResNet 模型将时间和频率维度同等对待。它们遵循为图像识别设计的默认步幅配置,其中水平轴和垂直轴表现出相似性。这种方法忽略了时间和频率在语音表示中具有不对称性的事实。在本文中,我们解决了这一问题,并寻找专门为声纹验证量身定制的最优步幅配置。我们在网格图上表示步幅空间,系统地研究了时间和频率分辨率对性能的影响,并进一步确定了两个最优点,即 Golden Gemini,这为设计基于 2D ResNet 的声纹验证模型提供了指导原则。遵循该原则,一个最先进的 ResNet 基线模型在 VoxCeleb、SITW 和 CNCeleb 数据集上获得了显著的性能提升,在不同网络深度(ResNet18、34、50 和 101)下平均 EER/minDCF 分别降低了 7.70%/11.76%,同时参数量减少了 16.5%,FLOPs 减少了 4.1%。我们将其称为 Gemini ResNet。进一步的研究表明,所提出的 Golden Gemini 工作点在各种训练条件和架构下均具有有效性。此外,我们使用前沿模型提出了一个新基准,即 Gemini DF-ResNet。
引用
@article{arxiv.2312.03620,
title = {Golden Gemini is All You Need: Finding the Sweet Spots for Speaker Verification},
author = {Tianchi Liu and Kong Aik Lee and Qiongqiong Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2312.03620},
year = {2024}
}
备注
Accepted to IEEE/ACM Transactions on Audio, Speech, and Language Processing. Open Access: https://ieeexplore.ieee.org/abstract/document/10497864