中文

基于注意力说话人嵌入的多用户 VoiceFilter-Lite

音频与语音处理 2021-11-09 v2 机器学习 声音

摘要

本文提出一种方案,使说话人条件语音模型(如 VoiceFilter-Lite)能够在单次前向中支持任意数量的注册用户。这是通过对多个说话人嵌入使用注意力机制来计算单一注意力嵌入实现的,该嵌入随后作为模型的侧输入。我们实现了多用户 VoiceFilter-Lite,并针对三项任务进行评估:(1)流式自动语音识别(ASR)任务;(2)文本无关说话人验证任务;(3)个性化关键短语检测任务,其中 ASR 需在噪声环境中从多个注册用户检测关键短语。我们的实验表明,在最多四个注册用户时,多用户 VoiceFilter-Lite 能在存在重叠语音时显著降低语音识别与说话人验证错误,且不影响其他声学条件下的性能。该注意力说话人嵌入方法也可轻松应用于其他说话人条件模型,如 personal VAD 与个性化 ASR。

关键词

引用

@article{arxiv.2107.01201,
  title  = {Multi-user VoiceFilter-Lite via Attentive Speaker Embedding},
  author = {Rajeev Rikhye and Quan Wang and Qiao Liang and Yanzhang He and Ian McGraw},
  journal= {arXiv preprint arXiv:2107.01201},
  year   = {2021}
}