中文

FairASR: 用于自动语音识别的公平音频对比学习

音频与语音处理 2025-06-13 v1

摘要

大规模ASR模型在准确性和鲁棒性方面取得了显著提升。然而,尽管公平性问题在现实应用中至关重要,但尚未得到充分解决。在本工作中,我们提出了FairASR,一个通过学习与群体成员身份无关的表征来缓解人口统计偏差的系统,从而实现不同人口统计群体间的公平泛化。利用多人口统计数据,我们的方法采用梯度反转层来抑制人口统计判别性特征,同时通过无监督对比损失保持捕捉可泛化语音模式的能力。实验结果表明,FairASR在保持整体ASR性能竞争力的同时,显著降低了不同人口统计群体之间的性能差异。

关键词

引用

@article{arxiv.2506.10747,
  title  = {FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition},
  author = {Jongsuk Kim and Jaemyung Yu and Minchan Kwon and Junmo Kim},
  journal= {arXiv preprint arXiv:2506.10747},
  year   = {2025}
}

备注

Accepted to Interspeech2025