用于语音识别的仅解码器架构:基于 CTC 提示与文本数据增强
音频与语音处理
2024-01-10 v2 声音
摘要
收集音频-文本对代价高昂;然而,获取纯文本数据要容易得多。除非使用浅融合,端到端自动语音识别(ASR)模型需要修改架构或采用额外训练方案以利用纯文本数据。受近期仅解码器语言模型(LMs)(如用于语音处理任务的 GPT-3 和 PaLM)进展的启发,我们提出使用仅解码器架构进行 ASR,并配以简单的文本增强。为提供音频信息,由 CTC 预测压缩的编码器特征被用作解码器的提示,可视为利用仅解码器模型精炼 CTC 预测。由于解码器架构与自回归 LM 相同,通过利用外部文本数据结合 LM 训练来增强模型十分简便。使用 LibriSpeech 和 Switchboard 的实验比较表明,我们提出的带文本增强训练的模型在 LibriSpeech test-clean 和 test-other 集上分别将词错误率较普通 CTC 降低了 0.3% 和 1.4%,在 Switchboard 和 CallHome 上分别降低了 2.9% 和 5.0%。所提模型在参数设置相似的情况下相较传统编码器-解码器 ASR 模型具有计算效率优势,并在 LibriSpeech 100h 和 Switchboard 训练场景下优于它们。
引用
@article{arxiv.2309.08876,
title = {Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation},
author = {Emiru Tsunoo and Hayato Futami and Yosuke Kashiwagi and Siddhant Arora and Shinji Watanabe},
journal= {arXiv preprint arXiv:2309.08876},
year = {2024}
}