面向第二语言说话者的公平语音识别:基于公平性提示微调
计算与语言
2026-01-27 v2
摘要
本 work addresses 面向第二语言说话者构建公平 English ASR 系统的挑战。我们分析了广泛使用的 ASR 模型 Whisper 和 Seamless-M4T,发现其在 26 个accent group 之间的词错误率 (WER) 存在显著波动,表明存在显著的公平性差距。为缓解这一问题,我们提出了采用轻量级适配器的公平性提示微调 (finetuning),融合了 Spectral Decoupling (SD)、Group Distributionally Robust Optimization (Group-DRO) 和 Invariant Risk Minimization (IRM)。我们提出的将传统经验风险最小化 (ERM) 与交叉熵和公平性驱动目标 (SD、Group DRO 和 IRM) 融合的方法,提高了accent group 之间的公平性,同时保持整体识别准确率。就宏平均词错误率而言,我们的方法相对于大型预训练 Whisper 和 SeamlessM4T 分别实现了 58.7% 和 58.5% 的相对改进,相对于它们使用标准经验风险最小化进行交叉熵 loss 的微调,分别实现了 9.7% 和 7.8% 的改进。
引用
@article{arxiv.2510.18374,
title = {Towards Fair ASR For Second Language Speakers Using Fairness Prompted Finetuning},
author = {Monorama Swain and Bubai Maji and Jagabandhu Mishra and Markus Schedl and Anders Søgaard and Jesper Rindom Jensen},
journal= {arXiv preprint arXiv:2510.18374},
year = {2026}
}
备注
Accepted in ICASSP 2026