延迟NAM:通过延迟上下文编码实现非流式语音识别的低延迟Top-K上下文注入
计算与语言
2024-04-24 v2 人工智能
机器学习
神经与进化计算
音频与语音处理
摘要
上下文偏置使语音识别器能够转录说话者上下文中的重要短语,例如联系人姓名,即使这些短语在训练数据中罕见或不存在。基于注意力的偏置是一种领先的方法,它允许识别器和偏置系统进行完全的端到端联合训练,并且不需要单独的推理时组件。这种偏置器通常由一个上下文编码器组成;然后是一个上下文过滤器,它缩小要应用的上下文范围,改善每步推理时间;最后,通过交叉注意力进行上下文应用。尽管在优化每帧性能方面做了大量工作,但上下文编码器至少同样重要:在上下文编码结束之前,识别无法开始。在这里,我们展示了轻量级的短语选择过程可以移到上下文编码之前,从而实现高达16.1倍的加速,并使偏置能够扩展到20K个短语,最大预解码延迟低于33毫秒。通过添加短语级和词片级交叉熵损失,我们的技术相对于没有损失和轻量级短语选择过程的基线,实现了高达37.5%的相对词错误率降低。
引用
@article{arxiv.2404.10180,
title = {Deferred NAM: Low-latency Top-K Context Injection via Deferred Context Encoding for Non-Streaming ASR},
author = {Zelin Wu and Gan Song and Christopher Li and Pat Rondon and Zhong Meng and Xavier Velez and Weiran Wang and Diamantino Caseiro and Golan Pundak and Tsendsuren Munkhdalai and Angad Chandorkar and Rohit Prabhavalkar},
journal= {arXiv preprint arXiv:2404.10180},
year = {2024}
}
备注
9 pages, 3 figures, accepted by NAACL 2024 - Industry Track