缩小单用户与多用户VoiceFilter-Lite之间的差距
音频与语音处理
2022-04-28 v2 机器学习
机器学习
摘要
VoiceFilter-Lite是一种说话人条件化的语音分离模型,通过抑制来自非目标说话人的重叠语音,在改善语音识别与说话人验证方面发挥关键作用。然而,VoiceFilter-Lite及其他说话人条件化语音模型的局限在于,这些模型通常限于单一目标说话人。这是不合意的,因为大多数智能家居设备现在支持多个注册用户。为将个性化益处扩展至多用户,我们此前开发了基于注意力的说话人选择机制并将其应用于VoiceFilter-Lite。然而,原始多用户VoiceFilter-Lite模型相比单用户模型存在显著的性能下降。在本文中,我们设计了一系列实验以改进多用户VoiceFilter-Lite模型。通过引入双学习率调度,并使用特征线性调制(FiLM)以注意力得到的说话人嵌入对模型进行条件化,我们成功在单说话人评测上缩小了多用户与单用户VoiceFilter-Lite模型之间的性能差距。同时,新模型也可轻松扩展以支持任意数量的用户,并在多说话人评测上显著优于我们此前发布的模型。
引用
@article{arxiv.2202.12169,
title = {Closing the Gap between Single-User and Multi-User VoiceFilter-Lite},
author = {Rajeev Rikhye and Quan Wang and Qiao Liang and Yanzhang He and Ian McGraw},
journal= {arXiv preprint arXiv:2202.12169},
year = {2022}
}