WhisTLE:针对预训练语音识别变换器的深度监督文本-only 域适应
计算与语言
2026-05-26 v2 机器学习
摘要
预训练的自动语音识别(ASR)模型如Whisper表现良好,但仍需进行域适应以处理未见的语言环境。在许多实际场景中,收集语音数据往往不可行, necessitating 文本-only适应。我们提出WhisTLE,一种针对预训练编码器-解码器ASR模型的深度监督文本-only适应方法。WhisTLE训练一个变分自编码器(VAE)来建模来自文本的编码器输出,并使用所学的文本到潜在编码器进行解码器微调,可选地结合文本到语音(TTS)适应。在推理时,恢复原始编码器,无需额外运行时开销。我们在四个数据集和四个ASR模型上进行测试,WhisTLE配合TTS将词错误率(WER)降低约49.0%,并在112个场景中的100个情形中超越所有非WhisTLE基线。我们还发现WhisTLE可与其他任何域适应方法叠加式地互补;因此,我们建议在标准化适应编码器-解码器ASR模型的过程中包含WhisTLE。
引用
@article{arxiv.2509.10452,
title = {WhisTLE: Deeply Supervised, Text-Only Domain Adaptation for Pretrained Speech Recognition Transformers},
author = {Akshat Pandey and Karun Kumar and Raphael Tang},
journal= {arXiv preprint arXiv:2509.10452},
year = {2026}
}
备注
10 pages