中文

基于无关对比混合的AC-Mix:面向低资源自动语音识别的自监督适应

音频与语音处理 2025-08-28 v1 声音

摘要

自监督学习(SSL)利用大量无标签数据学习丰富的语音表征,推动了自动语音识别(ASR)的进步,即使仅有少量可用标签数据进行微调。尽管SSL已取得进展,但当预训练数据(源域)与微调数据(目标域)不匹配时,仍面临显著挑战。为解决此问题,本文提出一种针对低资源ASR的新型域适应方法,聚焦于对比混合技术,适用于无关对比混合(AC-Mix)的联合嵌入架构。在该方法中,通过对源域和目标域样本进行插值创建混合数据视图,对SSL模型进行额外预训练实现适应。我们的方法在基线系统上 consistently 取得优异性能,使用约11小时适应数据,在单GPU上仅需1小时适应时间即可实现WavLM-Large模型的适应。

关键词

引用

@article{arxiv.2410.14910,
  title  = {AC-Mix: Self-Supervised Adaptation for Low-Resource Automatic Speech Recognition using Agnostic Contrastive Mixup},
  author = {Carlos Carvalho and Alberto Abad},
  journal= {arXiv preprint arXiv:2410.14910},
  year   = {2025}
}