CS-Rep:使说话人验证网络支持重参数化
声音
2022-04-05 v2 机器学习
音频与语音处理
摘要
自动说话人验证(ASV)系统用于判断两段语音是否来自同一说话人,其主要关注验证准确率而忽略推理速度。然而在实际应用中,推理速度与验证准确率同样关键。本研究提出跨序列重参数化(CS-Rep),一种面向多类型网络的新型拓扑重参数化策略,以提升模型的推理速度与验证准确率。CS-Rep解决了现有重参数化方法不适用于典型ASV骨干网络的问题。当模型应用CS-Rep时,训练期网络利用多分支拓扑捕获说话人信息,而推理期模型则转换为类时延神经网络(TDNN)的、由堆叠TDNN层构成的 Plain 骨干网络,以实现快速推理速度。基于CS-Rep,提出一种便于测试与部署的改进TDNN,称为Rep-TDNN。与业界高度认可的SOTA模型ECAPA-TDNN相比,Rep-TDNN实际推理速度提升约50%,等错误率(EER)降低10%。代码将开源。
引用
@article{arxiv.2110.13465,
title = {CS-Rep: Making Speaker Verification Networks Embracing Re-parameterization},
author = {Ruiteng Zhang and Jianguo Wei and Wenhuan Lu and Lin Zhang and Yantao Ji and Junhai Xu and Xugang Lu},
journal= {arXiv preprint arXiv:2110.13465},
year = {2022}
}
备注
Accepted by ICASSP 2022