中文

自监督语音识别模型音素级嵌入中人口统计公平性的识别与类型化

计算与语言 2026-04-27 v1

摘要

现代自动语音识别(ASR)系统被观察到对特定说话人群组(SGs)的功能性能优于其他群组,尽管近期在整体性能上取得了进步。向更公平的 ASR 迈进的一个潜在障碍是对语音编码器模型所作建模错误的更细致理解,特别是高性能和低性能 SGs 之间的嵌入结构差异。本文提出了一个框架,用于类型化 ASR 系统中音素建模可能发生的两种错误类型:随机错误/高方差的音素嵌入,与系统性错误/嵌入偏差。我们发现,仅在单个(通常是劣势)SG 上训练音素分类探针,有时会提高该 SG 的性能,这表明了音素嵌入中存在 SG 级别的偏差。另一方面,我们发现说话人和 SGs 具有更高水平音素方差的群组,与更差的音素预测准确率的群组相同。我们得出结论,音素嵌入中同时存在这两种错误类型,两者都是导致 ASR 中 SG 级别不公平的候选原因,尽管随机错误可能对公平性的阻碍更大。此外,我们发现使用公平性增强算法(域增强和对抗性训练)进行微调的编码器模型,既不会改变基于单一 SG 的音素分类探针训练的益处,也不会改变测量的随机嵌入错误水平。

关键词

引用

@article{arxiv.2604.22631,
  title  = {Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models},
  author = {Felix Herron and Solange Rossato and Alexandre Allauzen and François Portet},
  journal= {arXiv preprint arXiv:2604.22631},
  year   = {2026}
}