中文

用于对话自动转写的环境相关RNNLM

音频与语音处理 2020-08-11 v1

摘要

会话语音虽然在话语层面无结构,但通常具有跨越多个话语的宏观主题以提供更大上下文。当前语音识别系统中使用循环神经网络(RNNLM)的语言模型主要依赖局部上下文而排除更大上下文。为建模跨多个句子的词语长期依赖,我们提出一种新颖架构,将先前话语中的词转换为嵌入向量。使用门控网络求这些嵌入向量对当前句中下一词预测的相关性。将相关性加权的上下文嵌入向量结合进语言模型以改进下一词预测,且包含上下文嵌入与相关加权层的整个模型针对会话语言建模任务进行联合学习。实验在两个会话数据集上进行——AMI语料库和Switchboard语料库。在这些任务中,我们表明所提方法在语言模型困惑度上相较RNNLM基线取得显著提升。此外,将所提会话LM用于ASR重打分,在Switchboard数据集上相较基于RNNLM的ASR基线实现了1.2%的绝对词错率(WER)降低,在AMI数据集上降低1.0%。

关键词

引用

@article{arxiv.2008.03517,
  title  = {Context Dependent RNNLM for Automatic Transcription of Conversations},
  author = {Srikanth Raj Chetupalli and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2008.03517},
  year   = {2020}
}

备注

Manuscript accepted for publication at INTERSPEECH 2020, Oct 25-29, Shanghai, China