利用树约束指针生成器最小化偏置词错误以实现上下文ASR
计算与语言
2024-10-28 v2 声音
音频与语音处理
摘要
上下文知识对于减少高价值长尾词的语音识别错误至关重要。本文提出一种新颖的树约束指针生成器(TCPGen)组件,使端到端ASR模型能够偏置于使用外部上下文信息获得的长尾词列表。TCPGen仅以极小的内存占用与计算代价,即可将数千个偏置词高效组织为符号化前缀树,并在该树与最终ASR输出之间建立神经捷径,以促进偏置词的识别。为增强TCPGen,我们进一步提出一种新颖的最小偏置词错误(MBWE)损失,在训练期间直接优化偏置词错误,以及一种测试期间的偏置词驱动语言模型折扣(BLMD)方法。所有上下文ASR系统在公开Librispeech有声书语料库及对话状态跟踪挑战(DSTC)数据上进行了评估,偏置列表提取自对话系统本体。使用TCPGen一致地实现了词错误率(WER)的降低,在偏置词上尤为显著,识别错误率相对降低约40%。MBWE与BLMD进一步提升了TCPGen的有效性,并在偏置词上实现了更显著的WER降低。TCPGen还实现了对音频训练集中未出现词的零样本学习,在偏置列表中的集外词上取得大幅WER降低。
引用
@article{arxiv.2205.09058,
title = {Minimising Biasing Word Errors for Contextual ASR with the Tree-Constrained Pointer Generator},
author = {Guangzhi Sun and Chao Zhang and Philip C Woodland},
journal= {arXiv preprint arXiv:2205.09058},
year = {2024}
}
备注
This work has been submitted to the IEEE Transactions on Audio, Speech, and Language Processing for possible publication