基于关键词掩码估计的说话人选择性波束成形器
音频与语音处理
2018-11-08 v2 机器学习
声音
摘要
本文解决背景语音中目标说话人的自动语音识别(ASR)问题。我们方法的新颖之处在于关注唤醒关键词,该关键词通常用于激活如智能音箱等 ASR 系统。所提方法首先利用基于 DNN 的掩码估计器将混合信号分离为目标说话人发出的关键词信号与剩余的背景语音。随后利用分离出的信号计算波束成形滤波器,以增强来自目标说话人的后续语音。实验评估表明,训练得到的基于 DNN 的掩码能够选择性地从混合信号中分离关键词与背景语音。所提方法的有效性也通过日语 ASR 实验得到验证,我们确认在模拟和真实录制的测试集上,所提方法均显著改善了字符错误率。
引用
@article{arxiv.1810.10727,
title = {Speaker Selective Beamformer with Keyword Mask Estimation},
author = {Yusuke Kida and Dung Tran and Motoi Omachi and Toru Taniguchi and Yuya Fujita},
journal= {arXiv preprint arXiv:1810.10727},
year = {2018}
}
备注
Accepted by SLT2018