基于声学语言模型预训练端到端语音识别与不流畅去除
音频与语音处理
2023-09-12 v1 机器学习
声音
摘要
近年来,不流畅与对话语音转写的最优方法(SOTA)倾向于两阶段模型,即分离的转写与清洗阶段。我们认为,先前端到端不流畅去除的尝试未达预期,是因为大规模语言模型预训练赋予词汇模型以表征优势。直至近来,音频数据集的高维度与有限规模阻碍了用于学习有效音频表征的大规模自监督预训练目标的发展,从而相对有利于利用词汇 token 预训练表征的两阶段方法。鉴于近期大规模音频预训练的成功,我们重新审视两阶段与端到端模型的性能比较,发现使用弱自监督目标预训练的基于音频的语言模型匹配或超越了类似训练的两阶段模型性能,并且进一步发现预训练目标的选择显著影响模型适应不流畅去除任务的能力。
引用
@article{arxiv.2309.04516,
title = {End-to-End Speech Recognition and Disfluency Removal with Acoustic Language Model Pretraining},
author = {Saksham Bassi and Giulio Duregon and Siddhartha Jalagam and David Roth},
journal= {arXiv preprint arXiv:2309.04516},
year = {2023}
}