中文

k2SSL:面向自监督语音表征学习的更快更好框架

音频与语音处理 2025-03-25 v2

摘要

自监督学习 (SSL) 在语音相关任务中取得了很大成功。虽然 Transformer 和 Conformer 架构主导了 SSL 的骨干网络,但在 SSL 中仍未得到探索的编码器如 Zipformer 在自动语音识别 (ASR) 中表现突出。同时,现有 SSL 训练框架(如 fairseq)中数据处理效率低下,面临日益增长的训练数据量管理挑战。为此,我们提出 k2SSL,一个开源框架,提供更快、更节省内存且表现更好的自监督语音表征学习,专注于下游 ASR 任务。实验表明,优化后的 HuBERT 与提出的基于 Zipformer 的 SSL 系统在 SSL 训练中的训练时间和内存使用率均显著降低。在 LibriSpeech 上进行的实验显示,Zipformer Base 在下游任务中显著优于 HuBERT 和 WavLM,微调后实现最高可达 34.8% 的相对 WER 降低,同时在 GPU 小时方面实现 3.5 倍的预训练加速。当扩展到 60k 小时的 LibriLight 数据时,Zipformer Large 展现出惊人的效率,仅需 HuBERT Large 的 5/8 的预训练步骤即可匹配其性能。

关键词

引用

@article{arxiv.2411.17100,
  title  = {k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning},
  author = {Yifan Yang and Jianheng Zhuo and Zengrui Jin and Ziyang Ma and Xiaoyu Yang and Zengwei Yao and Liyong Guo and Wei Kang and Fangjun Kuang and Long Lin and Daniel Povey and Xie Chen},
  journal= {arXiv preprint arXiv:2411.17100},
  year   = {2025}
}

备注

Accepted in ICME 2025