自监督学习中语言偏差:面向自动语音识别
音频与语音处理
2025-02-03 v1 人工智能
计算与语言
机器学习
信号处理
摘要
自监督学习 (SSL) 用于深度学习中在大规模数据集上进行训练,无需昂贵的数据标注。最近,类似 XLS-R 的大型自动语音识别 (ASR) 模型已利用 SSL 在超过一百种不同语言上进行同步训练。然而,更深入的调查显示,XLS-R 的训练数据大部分来自少数几种语言。虽然 SSL 已在多个领域证明存在偏差,但对多语言 SSL ASR 中的语言偏差尚未得到彻底考察。本文我们利用 Lottery Ticket Hypothesis (LTH) 在 XLS-R 中识别语言特定子网络,并测试这些子网络在各种不同语言上的性能。我们能够表明,在微调过程中,XLS-R 绕过了传统的语言知识,仅依赖于来自预训练数据中贡献最大的语言所学习到的权重。
引用
@article{arxiv.2501.19321,
title = {Language Bias in Self-Supervised Learning For Automatic Speech Recognition},
author = {Edward Storey and Naomi Harte and Peter Bell},
journal= {arXiv preprint arXiv:2501.19321},
year = {2025}
}
备注
Accepted to Speech and Language Technology Workshop (SLT) 2024 accessible on IEEE Xplore