中文

MixRep:用于低资源语音识别的隐表示混合增强

音频与语音处理 2025-06-19 v1 人工智能

摘要

在本文中,我们提出 MixRep,一种基于 mixup 的简洁有效的低资源 ASR 数据增强策略。MixRep 对神经网络中隐表示的特征维度进行插值,可应用于声学特征输入以及每一层的输出,从而推广了此前的 MixSpeech 方法。进一步,我们提出将 mixup 与沿输入时间轴的正则化相结合,其被证明是互补的。我们将 MixRep 应用于以联合 CTC 损失训练的 E2E LAS 架构的 Conformer 编码器。我们在 WSJ 数据集和 SWB 数据集的子集上进行实验,涵盖朗读语音与电话会话语音。实验结果表明,MixRep 在低资源 ASR 上持续优于其他正则化方法。与强力的 SpecAugment 基线相比,MixRep 在 eval92 集和 eval'2000 集的 Callhome 部分上分别实现了 +6.5% 和 +6.7% 的相对 WER 降低。

关键词

引用

@article{arxiv.2310.18450,
  title  = {MixRep: Hidden Representation Mixup for Low-Resource Speech Recognition},
  author = {Jiamin Xie and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2310.18450},
  year   = {2025}
}

备注

Accepted to Interspeech 2023