SpeakerStew:利用分诊式多语言文本相关与文本无关说话人验证系统扩展至多种语言
音频与语音处理
2021-06-17 v3 机器学习
声音
机器学习
摘要
在本文中,我们描述了 SpeakerStew——一个用于在46种语言上执行说话人验证的混合系统。该系统中探索了两个核心思想:(1) 将不同语言的训练数据汇集在一起以实现多语言泛化并缩短开发周期;(2) 在文本相关与文本无关模型之间采用一种新颖的分诊机制,以降低运行时成本和预期延迟。据我们所知,这是首个在46种语言规模上研究说话人验证系统的工作。该问题从智能音箱设备的视角出发进行构建,其交互包含唤醒关键词(文本相关)随后的语音查询(文本无关)。实验证据表明,在多种语言上训练可以对未见变体实现泛化,同时在已见变体上保持性能。我们还发现,它可以将训练模型的计算需求降低一个数量级。此外,在英语数据的模型推理过程中,我们观察到利用分诊框架可将对计算代价更高的文本无关系统的调用次数减少73%(并将延迟降低59%),同时保持等错误率(EER)不差于文本无关设置。
引用
@article{arxiv.2104.02125,
title = {SpeakerStew: Scaling to Many Languages with a Triaged Multilingual Text-Dependent and Text-Independent Speaker Verification System},
author = {Roza Chojnacka and Jason Pelecanos and Quan Wang and Ignacio Lopez Moreno},
journal= {arXiv preprint arXiv:2104.02125},
year = {2021}
}