中文

基于仿射变换的说话人条件化声学模型用于多说话人语音识别

音频与语音处理 2021-11-02 v1 人工智能 机器学习 声音 信号处理

摘要

本研究解决了在重叠语音场景下针对目标说话人的单通道自动语音识别问题。在所提方法中,声学模型中的隐藏表示由说话人辅助信息调制,以仅识别期望的说话人。仿射变换层被插入声学模型网络中,以将说话人信息与声学特征相融合。说话人条件化过程使声学模型能够在目标说话人辅助信息的语境下进行计算。所提说话人条件化方法是一种通用方法,可应用于任何声学模型架构。在此,我们在ResNet声学模型上采用说话人条件化。在WSJ语料库上的实验表明,所提说话人条件化方法是将说话人辅助信息与声学特征融合用于多说话人语音识别的有效方案,相较于原始ResNet声学模型基线,在干净和重叠语音场景下分别实现了9%和20%的相对词错率(WER)降低。

关键词

引用

@article{arxiv.2111.00320,
  title  = {Speaker conditioning of acoustic models using affine transformation for multi-speaker speech recognition},
  author = {Midia Yousefi and John H. L. Hanse},
  journal= {arXiv preprint arXiv:2111.00320},
  year   = {2021}
}