中文

通过重写非自回归 ASR 词格进行拼写校正

计算与语言 2024-09-26 v1 声音 音频与语音处理

摘要

对于端到端自动语音识别 (ASR) 模型,识别个人或罕见短语可能很困难。提高准确性的一种有前途的方法是对 ASR 词格进行拼写校正(或重写),其中潜在被误识别的短语被替换为声学相似且上下文相关的备选项。然而,对于使用连接时序分类 (CTC) 训练的 ASR 模型,由于非自回归、上下文无关的束搜索产生有噪声的假设,重写具有挑战性。我们提出了一种有限状态转换器 (FST) 技术,用于重写由基于 Transformer 的 CTC 模型生成的词片词格。我们的算法直接从词片执行字素到音素 (G2P) 转换为音素,避免了显式的词表示,并利用了 CTC 词格的丰富性。我们的方法不需要对 ASR 模型进行重新训练或修改。在包含上下文相关实体的测试集上,我们实现了高达 15.2% 的句子错误率 (SER) 相对降低。

关键词

引用

@article{arxiv.2409.16469,
  title  = {Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices},
  author = {Leonid Velikovich and Christopher Li and Diamantino Caseiro and Shankar Kumar and Pat Rondon and Kandarp Joshi and Xavier Velez},
  journal= {arXiv preprint arXiv:2409.16469},
  year   = {2024}
}

备注

8 pages, 7 figures