中文

FusDom:结合域内与域外知识以实现连续自监督学习

音频与语音处理 2023-12-21 v1 人工智能 计算与语言 声音

摘要

持续预训练 (CP) 具有多项优势,例如目标域适应以及利用在线可用的连续无标签数据流的潜力。然而,在域外分布上进行持续预训练通常会导致先前获取知识的灾难性遗忘,从而导致次优的 ASR 性能。本文提出了 FusDom,一种用于基于 SSL 的持续预训练的简单且新颖的方法。FusDom 学习的语音表示具有鲁棒性和自适应性,且不会遗忘过去见过的概念。FusDom 不是在单一模型的输出表示上求解 SSL 前置任务,而是利用两个相同的预训练 SSL 模型(一个教师模型和一个学生模型),通过修改的预训练头来求解 CP SSL 前置任务。该头在两个模型的表示之间采用交叉注意力机制,同时仅学生模型接收梯度更新而教师模型不更新。最后,对学生模型进行针对 ASR 的微调。在实践中,FusDom 在各种设置下均显著优于我们所有的基线,在目标域实现了 0.2 WER 到 7.3 WER 范围的 WER 提升,同时保持了在先前域上的性能。

关键词

引用

@article{arxiv.2312.13026,
  title  = {FusDom: Combining In-Domain and Out-of-Domain Knowledge for Continuous Self-Supervised Learning},
  author = {Ashish Seth and Sreyan Ghosh and S. Umesh and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2312.13026},
  year   = {2023}
}

备注

Accepted at ICASSP 2024. Code: https://github.com/cs20s030/fusdom