中文

语音LLM中的交叉性偏见量化:语音背后的声音

音频与语音处理 2026-03-19 v1 计算与语言 声音

摘要

语音大型语言模型(SpeechLLMs)直接处理语音输入,保留了如重音和感知性别等说话人身份线索,这些线索在级联管道中先前被移除。这引入了基于说话人身份的响应变异。我们对三种SpeechLLMs进行大规模的交叉性评估,使用2,880个受控交互测试六种英语重音和两种性别呈现方式,保持语言内容恒定通过语音克隆。使用基于点的LLM评判评分、成对比较和最差-最佳比例尺进行人类验证,我们检测到一致的差异。东欧重音的语音在女性呈现语音方面获得较低的帮助fulness评分。这种偏见是隐式的:响应保持礼貌,但在帮助fulness上存在差异。虽然LLM评判捕捉了这些偏见的方向性趋势,但人类评估者敏感性显著更高,揭示了更尖锐的交叉性差异。

关键词

引用

@article{arxiv.2603.16941,
  title  = {The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs},
  author = {Shree Harsha Bokkahalli Satish and Christoph Minixhofer and Maria Teleki and James Caverlee and Ondřej Klejch and Peter Bell and Gustav Eje Henter and Éva Székely},
  journal= {arXiv preprint arXiv:2603.16941},
  year   = {2026}
}

备注

5 pages, 3 figures, 1 table, Submitted to Interspeech 2026