用于解耦注册与运行时说话人识别模型的训练后嵌入对齐
音频与语音处理
2024-06-28 v1 机器学习
声音
摘要
自动说话人识别(SID)是众多语音服务个性化的关键步骤。典型的SID系统采用对称的注册-验证框架,使用单一模型为从注册语音中提取的离线声纹和从运行时语音中提取的在线声纹生成嵌入。由于注册和运行时的不同情况,例如不同的计算和延迟约束,一些应用将受益于使用不同模型分别进行注册和运行时嵌入生成的非对称注册-验证框架。为了支持这种两个模型可以独立更新的非对称SID,我们提出使用一个轻量级神经网络将来自两个独立模型的嵌入映射到一个共享的说话人嵌入空间。我们的结果表明,对于在具有大量说话人身份的大规模数据集上使用对比损失训练的模型,这种方法在共享说话人logit空间中的余弦评分性能显著优于直接余弦评分。这种提出的神经嵌入说话人空间对齐(NESSA)方法,结合仅更新其中一个模型的非对称更新策略,至少能实现标准对称SID方法中同时更新两个模型所获性能增益的60%。
引用
@article{arxiv.2401.12440,
title = {Post-Training Embedding Alignment for Decoupling Enrollment and Runtime Speaker Recognition Models},
author = {Chenyang Gao and Brecht Desplanques and Chelsea J. -T. Ju and Aman Chadha and Andreas Stolcke},
journal= {arXiv preprint arXiv:2401.12440},
year = {2024}
}
备注
Accepted to ICASSP 2024