中文

检索与复制:将ASR个性化扩展至大规模目录

计算与语言 2023-11-15 v1 信息检索 声音 音频与语音处理

摘要

自动语音识别(ASR)模型的个性化因诸多实际应用而被广泛研究。最近,基于注意力的上下文偏置技术被用于改善罕见词和领域特定实体的识别。然而,受性能限制,偏置常局限于数千实体,制约了实际可用性。为此,我们首先提出“检索与复制”机制,在扩展至大规模目录时仍保持精度并改善延迟。我们还提出一种训练策略,以克服因混淆实体增多而导致的此类规模下召回率退化。总体而言,相比强基线,我们的方法实现了高达6%的更优词错误率降低(WERR)和3.6%的F1绝对提升。我们的方法也支持高达20K的大目录规模,且不显著影响WER与F1分数,同时每个声学帧实现至少20%的推理加速。

关键词

引用

@article{arxiv.2311.08402,
  title  = {Retrieve and Copy: Scaling ASR Personalization to Large Catalogs},
  author = {Sai Muralidhar Jayanthi and Devang Kulshreshtha and Saket Dingliwal and Srikanth Ronanki and Sravan Bodapati},
  journal= {arXiv preprint arXiv:2311.08402},
  year   = {2023}
}

备注

EMNLP 2023