通过重写非自回归 ASR 词格进行拼写校正
计算与语言
2024-09-26 v1 声音
音频与语音处理
摘要
对于端到端自动语音识别 (ASR) 模型,识别个人或罕见短语可能很困难。提高准确性的一种有前途的方法是对 ASR 词格进行拼写校正(或重写),其中潜在被误识别的短语被替换为声学相似且上下文相关的备选项。然而,对于使用连接时序分类 (CTC) 训练的 ASR 模型,由于非自回归、上下文无关的束搜索产生有噪声的假设,重写具有挑战性。我们提出了一种有限状态转换器 (FST) 技术,用于重写由基于 Transformer 的 CTC 模型生成的词片词格。我们的算法直接从词片执行字素到音素 (G2P) 转换为音素,避免了显式的词表示,并利用了 CTC 词格的丰富性。我们的方法不需要对 ASR 模型进行重新训练或修改。在包含上下文相关实体的测试集上,我们实现了高达 15.2% 的句子错误率 (SER) 相对降低。
引用
@article{arxiv.2409.16469,
title = {Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices},
author = {Leonid Velikovich and Christopher Li and Diamantino Caseiro and Shankar Kumar and Pat Rondon and Kandarp Joshi and Xavier Velez},
journal= {arXiv preprint arXiv:2409.16469},
year = {2024}
}
备注
8 pages, 7 figures