中文

基于 BEST-RQ 的 Whisper 领域自适应自监督学习

计算与语言 2026-05-13 v2

摘要

自动语音识别(ASR)系统尽管经过大规模多语言训练,却在标注数据稀缺的低资源场景中仍显力不够。我们提出了 BEARD(BEST-RQ Encoder Adaptation with Re-training and Distillation),一种 novel 框架,用于适配 Whisper 的编码器。不同于传统自监督学习方法,BEARD 独特地将 BEST-RQ 目标与来自冻结教师编码器的知识蒸馏相结合,确保编码器与预训练解码器保持互补性。我们的实验聚焦于空中交通管控(ATC)通信领域的 ATCO2 语料库,该语料库具有非母语语音、噪声和专业术语。使用约 5000 小时的未标注语音进行 BEARD 训练,再用 2 小时的标注语音进行微调,所提出的方法显著优于以往基线模型和微调模型,实现了约 12% 的相对提升。到目前为止,我们是首个为 Whisper 领域适应引入自监督学习目标的工作。

关键词

引用

@article{arxiv.2510.24570,
  title  = {BEST-RQ-Based Self-Supervised Learning for Whisper Domain Adaptation},
  author = {Raphaël Bagat and Irina Illina and Emmanuel Vincent},
  journal= {arXiv preprint arXiv:2510.24570},
  year   = {2026}
}

备注

Accepted to ICASSP 2026