语音LLM中的交叉性偏见量化:语音背后的声音
音频与语音处理
2026-03-19 v1 计算与语言
声音
摘要
语音大型语言模型(SpeechLLMs)直接处理语音输入,保留了如重音和感知性别等说话人身份线索,这些线索在级联管道中先前被移除。这引入了基于说话人身份的响应变异。我们对三种SpeechLLMs进行大规模的交叉性评估,使用2,880个受控交互测试六种英语重音和两种性别呈现方式,保持语言内容恒定通过语音克隆。使用基于点的LLM评判评分、成对比较和最差-最佳比例尺进行人类验证,我们检测到一致的差异。东欧重音的语音在女性呈现语音方面获得较低的帮助fulness评分。这种偏见是隐式的:响应保持礼貌,但在帮助fulness上存在差异。虽然LLM评判捕捉了这些偏见的方向性趋势,但人类评估者敏感性显著更高,揭示了更尖锐的交叉性差异。
引用
@article{arxiv.2603.16941,
title = {The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs},
author = {Shree Harsha Bokkahalli Satish and Christoph Minixhofer and Maria Teleki and James Caverlee and Ondřej Klejch and Peter Bell and Gustav Eje Henter and Éva Székely},
journal= {arXiv preprint arXiv:2603.16941},
year = {2026}
}
备注
5 pages, 3 figures, 1 table, Submitted to Interspeech 2026