面向目标说话人语音识别的辅助干扰说话人损失
计算与语言
2019-06-27 v1 声音
音频与语音处理
摘要
本文针对目标说话人自动语音识别 (ASR) 提出一种新颖的辅助损失函数。我们的方法在给定目标说话人短样本的条件下,从多说话人单声道混合语音中自动提取并转写目标说话人的话语。所提出的辅助损失函数在训练过程中尝试额外最大化干扰说话人的 ASR 准确率。这将对网络起到正则化作用,以获得更好的说话人分离表示,从而在目标说话人 ASR 上取得更高准确率。我们在不同信干比条件下使用两人混合语音评估了所提方法。我们首先基于最先进的无格最大互信息构建了一个鲁棒的目标说话人 ASR 基线。该基线在测试集上取得了 18.06% 的词错误率 (WER),而使用干净数据训练的普通 ASR 产生了完全 corrupted 的结果(WER 为 84.71%)。随后,我们提出的损失相对于该强基线进一步将 WER 相对降低了 6.6%,达到了 16.87% 的 WER。除准确率提升外,我们还展示了该辅助损失对应的辅助输出分支甚至可用于干扰说话人语音的二级 ASR。
引用
@article{arxiv.1906.10876,
title = {Auxiliary Interference Speaker Loss for Target-Speaker Speech Recognition},
author = {Naoyuki Kanda and Shota Horiguchi and Ryoichi Takashima and Yusuke Fujita and Kenji Nagamatsu and Shinji Watanabe},
journal= {arXiv preprint arXiv:1906.10876},
year = {2019}
}
备注
Accepted to INTERSPEECH 2019