中文

自监督学习中语言偏差:面向自动语音识别

音频与语音处理 2025-02-03 v1 人工智能 计算与语言 机器学习 信号处理

摘要

自监督学习 (SSL) 用于深度学习中在大规模数据集上进行训练,无需昂贵的数据标注。最近,类似 XLS-R 的大型自动语音识别 (ASR) 模型已利用 SSL 在超过一百种不同语言上进行同步训练。然而,更深入的调查显示,XLS-R 的训练数据大部分来自少数几种语言。虽然 SSL 已在多个领域证明存在偏差,但对多语言 SSL ASR 中的语言偏差尚未得到彻底考察。本文我们利用 Lottery Ticket Hypothesis (LTH) 在 XLS-R 中识别语言特定子网络,并测试这些子网络在各种不同语言上的性能。我们能够表明,在微调过程中,XLS-R 绕过了传统的语言知识,仅依赖于来自预训练数据中贡献最大的语言所学习到的权重。

关键词

引用

@article{arxiv.2501.19321,
  title  = {Language Bias in Self-Supervised Learning For Automatic Speech Recognition},
  author = {Edward Storey and Naomi Harte and Peter Bell},
  journal= {arXiv preprint arXiv:2501.19321},
  year   = {2025}
}

备注

Accepted to Speech and Language Technology Workshop (SLT) 2024 accessible on IEEE Xplore