面向鸡尾酒会环境的说话人定向音视觉语音识别模型
音频与语音处理
2019-06-17 v1 计算与语言
计算机视觉与模式识别
声音
摘要
鸡尾酒会环境中的语音识别对于最先进的语音识别系统仍是一项重大挑战,因为从具有相似频率与时间特征的重叠语音背景中提取特定说话人的声学信号极为困难。我们提出在此任务中使用说话人定向的声学与音视觉模型。我们在混合 DNN-HMM 模型中,以目标说话人身份信息和来自目标说话人嘴部的视觉特征对声学特征进行补充。实验使用由 GRID 音视觉语料库通过将两个说话人的语音重叠于单一声道所生成的模拟鸡尾酒会数据进行。我们的纯音频基线取得了 26.3% 的 WER。音视觉模型将 WER 改善至 4.4%。引入说话人身份信息效果更为显著,将 WER 改善至 3.6%。然而,结合两种方法并未进一步显著提升性能。我们的工作表明,说话人定向模型能显著改善鸡尾酒会环境中的语音识别。
引用
@article{arxiv.1906.05962,
title = {Speaker-Targeted Audio-Visual Models for Speech Recognition in Cocktail-Party Environments},
author = {Guan-Lin Chao and William Chan and Ian Lane},
journal= {arXiv preprint arXiv:1906.05962},
year = {2019}
}
备注
Published in INTERSPEECH 2016