探索跨话语语音上下文用于Conformer-Transducer语音识别系统
音频与语音处理
2025-08-15 v1
摘要
本文研究了四种类型的跨话语语音上下文建模方法,用于流式和非流式Conformer-Transducer(C-T)ASR系统:i)输入音频特征拼接;ii)跨话语编码器嵌入拼接;iii)跨话语编码器嵌入池化投影;或iv)一种首次应用于C-T模型的新型基于语块的方案。我们为上下文C-T模型提出了一种高效的批量训练方案,该方案在每个小批量中使用拼接的语音话语,以最小化同步开销,同时保留跨话语语音上下文的顺序。实验在三种语言的四个基准语音数据集上进行:用于上下文C-T模型预训练的英语GigaSpeech和普通话Wenetspeech语料库;以及用于领域微调的英语DementiaBank Pitt和粤语JCCOCC MoCA老年人语音数据集。性能最佳的上下文C-T系统在预训练和微调阶段不使用跨话语语音上下文的情况下,始终优于各自的基线,在四个任务上分别实现了高达0.9%、1.1%、0.51%和0.98%绝对(6.0%、5.4%、2.0%和3.4%相对)的统计显著平均词错误率(WER)或字符错误率(CER)降低。它们相对于Wav2vec2.0-Conformer、XLSR-128和Whisper模型的性能竞争力,凸显了将跨话语语音上下文纳入当前语音基础模型的潜在益处。
引用
@article{arxiv.2508.10456,
title = {Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems},
author = {Mingyu Cui and Mengzhe Geng and Jiajun Deng and Chengxi Deng and Jiawen Kang and Shujie Hu and Guinan Li and Tianzi Wang and Zhaoqing Li and Xie Chen and Xunying Liu},
journal= {arXiv preprint arXiv:2508.10456},
year = {2025}
}