自监督语音模型何时变得不公平?
计算与语言
2026-04-21 v1
摘要
语音编码器模型已知会对某些说话人群组 (SGs) 的成员建模得更好。然而,迄今为止几乎没有工作从技术层面阐明这一现象的原因。我们在本研究中首次对预训练的自监督语音编码器模型 (S3Ms) 进行逐层公平性分析,针对说话人识别 (SID) 和自动语音识别 (ASR) 对每个嵌入层进行探测。我们发现 S3Ms 在两个任务中都会对特定 SGs 产生偏见,从最初的 latent 层就开始。此外,我们发现 SID 偏见与 ASR 偏见的层级模式相互矛盾:SID 偏见在最小化总体 SID 错误的层中被最小化;另一方面,ASR 偏见在最小化总体 ASR 错误的层中被最大化。对于 ASR 来说,这种相反的偏见/错误关系在探测预训练且微调用于 ASR 的 S3M 时仍然不受影响,这表明 SG 级别的偏见是在预训练阶段建立的,并且难以消除。
引用
@article{arxiv.2604.18249,
title = {Where Do Self-Supervised Speech Models Become Unfair?},
author = {Felix Herron and Maja Hjuler and Solange Rossato and Alexandre Allauzen and François Portet},
journal= {arXiv preprint arXiv:2604.18249},
year = {2026}
}