多说话人对话场景下基于注意力的多任务语音增强与说话人识别学习
音频与语音处理
2021-02-23 v2 声音
摘要
多任务学习(MTL)与注意力机制已被证明能在噪声环境中为各类语音相关任务有效提取鲁棒声学特征。在本研究中,我们提出一种基于注意力的 MTL(ATM)方法,该方法整合 MTL 与注意力加权机制,以同时实现执行语音增强(SE)与说话人识别(SI)的多模型学习结构。所提 ATM 系统由三部分组成:SE、SI 与注意力网络(AttNet)。SE 部分由长短期记忆(LSTM)模型构成,而深度神经网络(DNN)模型用于构建 SI 与 AttNet 部分。整体 ATM 系统首先提取代表性特征,随后在 LSTM-SE 中增强语音信号,并在 DNN-SI 中判定说话人身份。AttNet 基于 DNN-SI 计算权重,为 LSTM-SE 准备更好的代表性特征。我们在台湾普通话噪声下听力测试语句上测试了所提 ATM 系统。评估结果证实,所提系统能有效提升给定噪声输入的语音质量与可懂度。此外,SI 的准确率也可通过所提 ATM 系统显著改善。
引用
@article{arxiv.2101.02550,
title = {Attention-based multi-task learning for speech-enhancement and speaker-identification in multi-speaker dialogue scenario},
author = {Chiang-Jen Peng and Yun-Ju Chan and Cheng Yu and Syu-Siang Wang and Yu Tsao and Tai-Shih Chi},
journal= {arXiv preprint arXiv:2101.02550},
year = {2021}
}