基于序列到序列学习的语音识别错误幻觉生成
计算与语言
2021-04-02 v3 机器学习
摘要
自动语音识别(ASR)是一个不完美的过程,导致 ASR 输出文本与纯文本或转写文本相比存在某些不匹配。当使用纯文本数据训练口语理解或 ASR 系统时,一种已被验证可减少上述不匹配并防止性能退化的策略是:给定标准转写文本,幻觉生成 ASR 可能的输出。该领域先前工作侧重于在音素层面建模错误,同时使用词典将音素转换为词,通常辅以 FST 语言模型。我们提出了新颖的端到端模型,直接预测幻觉的 ASR 词序列输出,以输入词序列及相应音素序列为条件。这改进了先前已发表的结果,在域内 ASR 系统对未知数据转写以及域外 ASR 系统对无关任务音频转写中的错误召回率上均有提升,同时还探索了当可获取测试 ASR 系统有限表征数据时的中间场景。为验证该方法的外部有效性,我们还将幻觉的 ASR 错误用于增强口语问题分类器的训练,发现当训练时仅有稀少甚至零任务相关音频可用时,它们能使下游任务对真实 ASR 错误具备鲁棒性。
引用
@article{arxiv.2103.12258,
title = {Hallucination of speech recognition errors with sequence to sequence learning},
author = {Prashant Serai and Vishal Sunder and Eric Fosler-Lussier},
journal= {arXiv preprint arXiv:2103.12258},
year = {2021}
}
备注
Submitted to IEEE/ACM Transactions on Audio Speech and Language Processing