中文

DYNAC:基于动态词汇量的非自回归上下文偏置语音识别

计算与语言 2025-06-04 v1 声音 音频与语音处理

摘要

上下文偏置(CB)可提升自动语音识别对罕见和未见短语的表现。近期研究引入了动态词汇量,在自回归(AR)模型中将上下文短语表示为可扩展的 token。该方法提高了 CB 的准确率,但推理速度较慢。虽然动态词汇量可应用于连接ist时序分类(CTC)等非自回归(NAR)模型,但条件独立假设无法捕捉静态 token 与动态 token 之间的依赖关系。本文提出了 DYNAC(基于动态词汇量的 NAR 上下文偏置),这是一种将动态词汇量集成到中间层的自条件 CTC 方法。通过以动态词汇量为条件对编码器进行约束,DYNAC 在降低实时率(RTF)的同时,有效捕捉了静态 token 与动态 token 之间的依赖关系。实验结果表明,DYNAC 在 LibriSpeech 960 test-clean 测试集上将 RTF 降低了 81%,且词错误率仅下降 0.1 个百分点。

关键词

引用

@article{arxiv.2506.00422,
  title  = {DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition},
  author = {Yui Sudo and Yosuke Fukumoto and Muhammad Shakeel and Yifan Peng and Chyi-Jiunn Lin and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2506.00422},
  year   = {2025}
}

备注

Accepted to Interspeech 2025