中文

离散表示与自增强表示的融合用于多语言自动语音识别

声音 2024-11-28 v1 音频与语音处理

摘要

自监督学习 (SSL) 模型在 various speech-processing 任务中展现出卓越的能力。连续 SSL 表示虽然有效,但受制于高计算和存储需求。相反,离散 SSL 表示虽然性能略有下降,但通过去重和子词建模提高了输入序列效率,同时降低了传输和存储成本。为了提升离散表示在语音识别中的性能,我们引入一种新型融合机制,将两种离散表示集成在一起。该融合机制保留了离散表示的所有优势,同时通过整合互补信息来提升模型性能。此外,我们探索了“自增强”离散表示,这些表示对单个连续 SSL 表示应用变换,消除了融合机制对多个 SSL 模型的依赖,进一步降低了推理成本。在包含 LibriSpeech 和 ML-SUPERB 等基准数据集上的实验结果表明,与非融合基线相比,字符错误率分别提高了最高可达 19% 和 24%,验证了我们新方法的有效性。

关键词

引用

@article{arxiv.2411.18107,
  title  = {Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition},
  author = {Shih-heng Wang and Jiatong Shi and Chien-yu Huang and Shinji Watanabe and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2411.18107},
  year   = {2024}
}

备注

SLT 2024