大语言模型解码器是否公平地倾听?语言模型先验如何塑造语音识别中的偏见
计算与语言
2026-04-24 v1 人工智能
声音
摘要
随着预训练大语言模型取代语音识别中的任务特定解码器,一个关键问题 arises: 它们的数据驱动先验是否使识别在不同人口统计群体间更公平或更偏见? 我们在约 43,000 条utterance上评估九个模型,涵盖三个架构代际(CTC 无语言模型、encoder-decoder 带隐式 LM、LLM 基于显式预训练解码器),使用 Common Voice 24 和 Meta Fair-Speech,后者是消除词汇混淆的受控提示数据集. 在干净音频上,三个发现挑战了假设: LLM 解码器不会放大种族偏见(Granite-8B 在最佳人种公平性,max/min WER=2.28); Whisper 在印度语音上出现异常幻觉,大型 v3 时插入率飙升至 9.62%; 以及音频压缩比 LLM 规模更能预测音调公平性. 我们随后在 12 种声学退化条件下(stress-test)进行测试(包括噪声、混响、静音注入、块遮蔽),覆盖两个数据集,总计 216 次推理. 严重退化悖论性地压缩了公平性差距,因为所有群体收敛至高 WER,但静音注入放大了 Whisper 的音调偏见最高可达 4.64 倍,通过触发人口统计选择性幻觉. 在遮蔽下,Whisper 进入灾难性重复循环(51,797 次插入中 86%),而显式 LLM 解码器产生约 38 倍更少的插入,且重复几乎为零;高压缩音频编码(Q-former)即使在 LLM 解码器中也重新引入重复病理. 这些结果表明,音频编码器设计而非 LLM 规模,是实现公平且稳健语音识别的主要杠杆.
引用
@article{arxiv.2604.21276,
title = {Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition},
author = {Srishti Ginjala and Eric Fosler-Lussier and Christopher W. Myers and Srinivasan Parthasarathy},
journal= {arXiv preprint arXiv:2604.21276},
year = {2026}
}