端到端语音识别与不流畅去除
音频与语音处理
2020-09-30 v3 计算与语言
机器学习
声音
摘要
不流畅检测通常是自动语音识别(ASR)系统与下游任务之间的中间步骤。相比之下,本文旨在研究端到端语音识别与不流畅去除任务。我们具体探究是否有可能训练一个 ASR 模型,直接将不流畅语音映射为流畅转录文本,而无需依赖单独的不流畅检测模型。我们表明,端到端模型确实学会了直接生成流畅转录文本;然而,其性能略逊于由 ASR 系统和不流畅检测模型组成的基线流水线方法。我们还提出了两个可用于评估集成式 ASR 与不流畅模型的新指标。本文的发现可作为未来端到端语音识别与不流畅去除任务进一步研究的基准。
引用
@article{arxiv.2009.10298,
title = {End-to-End Speech Recognition and Disfluency Removal},
author = {Paria Jamshid Lou and Mark Johnson},
journal= {arXiv preprint arXiv:2009.10298},
year = {2020}
}