中文

一种用于两遍个性化语音唤醒的集成框架

音频与语音处理 2021-07-01 v1 声音

摘要

在本文中,我们展示了用于 2020 个性化语音触发挑战赛(PVTC2020)任务 1 的 XMUSPEECH 系统。任务 1 是在近距离通话数据上联合进行唤醒词检测与说话人验证。整个系统由一个关键词 spotting(KWS)子系统和一个说话人验证(SV)子系统组成。对于 KWS 系统,我们应用了时间深度可分离卷积残差网络(TDSC-ResNet)以提升系统性能。对于 SV 系统,我们提出了一种多任务学习网络,其中音素分支使用话语的字符标签训练,说话人分支使用说话人标签训练。音素分支使用连接主义时序分类(CTC)损失进行优化,其作为说话人分支的辅助模块。实验表明,与基线系统相比,我们的系统取得了显著改进。

关键词

引用

@article{arxiv.2106.15950,
  title  = {An Integrated Framework for Two-pass Personalized Voice Trigger},
  author = {Dexin Liao and Jing Li and Yiming Zhi and Song Li and Qingyang Hong and Lin Li},
  journal= {arXiv preprint arXiv:2106.15950},
  year   = {2021}
}