中文

利用树约束指针生成器最小化偏置词错误以实现上下文ASR

计算与语言 2024-10-28 v2 声音 音频与语音处理

摘要

上下文知识对于减少高价值长尾词的语音识别错误至关重要。本文提出一种新颖的树约束指针生成器(TCPGen)组件,使端到端ASR模型能够偏置于使用外部上下文信息获得的长尾词列表。TCPGen仅以极小的内存占用与计算代价,即可将数千个偏置词高效组织为符号化前缀树,并在该树与最终ASR输出之间建立神经捷径,以促进偏置词的识别。为增强TCPGen,我们进一步提出一种新颖的最小偏置词错误(MBWE)损失,在训练期间直接优化偏置词错误,以及一种测试期间的偏置词驱动语言模型折扣(BLMD)方法。所有上下文ASR系统在公开Librispeech有声书语料库及对话状态跟踪挑战(DSTC)数据上进行了评估,偏置列表提取自对话系统本体。使用TCPGen一致地实现了词错误率(WER)的降低,在偏置词上尤为显著,识别错误率相对降低约40%。MBWE与BLMD进一步提升了TCPGen的有效性,并在偏置词上实现了更显著的WER降低。TCPGen还实现了对音频训练集中未出现词的零样本学习,在偏置列表中的集外词上取得大幅WER降低。

关键词

引用

@article{arxiv.2205.09058,
  title  = {Minimising Biasing Word Errors for Contextual ASR with the Tree-Constrained Pointer Generator},
  author = {Guangzhi Sun and Chao Zhang and Philip C Woodland},
  journal= {arXiv preprint arXiv:2205.09058},
  year   = {2024}
}

备注

This work has been submitted to the IEEE Transactions on Audio, Speech, and Language Processing for possible publication