基于声学的语音感知语言模型中的性别差异化
计算与语言
2025-09-26 v1
摘要
语音感知语言模型(SpeechLMs)通过语音交互方式彻底变革了人机交互,但可能存在基于声学的性别差异化,即相同问题因说话者性别而产生不同响应。本文提出一个新数据集,系统性分析这一现象,包含9,208个语音样本,分为性别无关、性别典型和性别相关三类。我们进一步评估了LLaMA-Omni系列模型,发现存在悖论模式;尽管整体响应似乎与性别无关,但模式远非公平。具体而言,在性别典型问题中,所有模型都表现出偏向男性的响应;而在性别相关问题中,模型却表现出性别无关的响应。我们也确认这一模式并非源于中性选项或语音感知的性别。当允许中性响应时,模型也倾向于在性别相关问题中给出中性响应。即使应用性别中性化方法,悖论模式仍然存在。通过比较语音LMs与相应基础LLMs,我们确认这些悖论模式主要源自Whisper语音编码器,其生成男性倾向的声学标记。这些发现表明,当前的SpeechLMs可能未能成功消除性别偏见,尽管它们优先考虑了一般公平原则而非情境恰当性,凸显了在语音技术中正确利用性别信息的更复杂技术的必要性。
关键词
引用
@article{arxiv.2509.21125,
title = {Acoustic-based Gender Differentiation in Speech-aware Language Models},
author = {Junhyuk Choi and Jihwan Seol and Nayeon Kim and Chanhee Cho and EunBin Cho and Bugeun Kim},
journal= {arXiv preprint arXiv:2509.21125},
year = {2025}
}
备注
Under Review