基于CTC软VAD与全局查询注意力的抗噪关键词 spotting 与说话人验证多任务网络
音频与语音处理
2020-08-10 v4 计算与语言
机器学习
声音
摘要
关键词 spotting(KWS)与说话人验证(SV)虽已知声学与说话人域具有互补性,却一直被独立研究。本文提出一种同时执行 KWS 与 SV 的多任务网络,以充分利用相互关联的域信息。该多任务网络通过引入基于连接主义时序分类(CTC)的软语音活动检测(VAD)与全局查询注意力等新技术,紧密耦合子网络,旨在提升噪声环境、开放词汇 KWS 与短时长 SV 等困难条件下的性能。帧级声学与说话人信息以语音起源的权重进行整合,从而形成词级全局表示,并用于特征向量的聚合以生成判别性嵌入。相比两项任务的基线,我们所提方法在等错误率(EER)上分别取得 4.06% 与 26.71% 的相对提升。我们还给出了可视化示例与消融实验结果。
引用
@article{arxiv.2005.03867,
title = {Multi-Task Network for Noise-Robust Keyword Spotting and Speaker Verification using CTC-based Soft VAD and Global Query Attention},
author = {Myunghun Jung and Youngmoon Jung and Jahyun Goo and Hoirin Kim},
journal= {arXiv preprint arXiv:2005.03867},
year = {2020}
}
备注
Accepted to Interspeech 2020