利用自适配与多头自注意力进行语音增强
音频与语音处理
2020-02-17 v1 机器学习
声音
机器学习
摘要
本文研究了一种利用辅助说话人感知特征进行语音增强的自适配方法;我们直接从测试语句中提取用于适配的说话人表示。基于深度神经网络(DNN)的语音增强的传统研究主要集中于构建说话人无关模型。同时,在包括语音识别与合成的语音应用中,已知对目标说话人的模型适配可提高准确率。我们的研究问题是,语音增强的DNN能否在测试阶段无任何辅助引导信号的情况下适配未知说话人。为此,我们采用语音增强与说话人识别的多任务学习,并将说话人识别分支最终隐藏层的输出作为辅助特征。此外,我们使用多头自注意力来捕获语音与噪声中的长期依赖。在公开数据集上的实验结果表明,我们的策略取得了最先进的性能,并且在主观质量上也优于传统方法。
引用
@article{arxiv.2002.05873,
title = {Speech Enhancement using Self-Adaptation and Multi-Head Self-Attention},
author = {Yuma Koizumi and Kohei Yatabe and Marc Delcroix and Yoshiki Masuyama and Daiki Takeuchi},
journal= {arXiv preprint arXiv:2002.05873},
year = {2020}
}
备注
5 pages, to appear in IEEE ICASSP 2020