中文

ERM-MinMaxGAP:面向多语言多模态语音-LLM 情感识别的性别偏差基准测试与缓解

声音 2026-03-24 v1

摘要

语音情感识别(SER)系统可能存在性别相关的性能差异,但这种偏差在多语言语音 LLM 跨语言和跨模态中的具体表现尚不清晰。我们构建了一个基于 MELD-ST 的新型多语言、多模态基准测试,覆盖英语、日语和德语,用于量化各语言中 SER 性能和性别差距。我们发现偏差强烈依赖于语言,多模态融合并不可靠地改善公平性。为此,我们提出了 ERM-MinMaxGAP,一种受公平性启发的训练目标,它在经验风险最小化(ERM)基础上增补了一个自适应公平权重机制,以及一种基于每个语言和模态中最大男性-女性损失差距的新型 MinMaxGAP 正则化器。在 Qwen2-Audio 基础模型上实现,我们的 ERM-MinMaxGAP 方法在单模态和多模态设置中分别提升了 5.5% 和 5.0% 的多语言 SER 性能,同时将整体性别偏差间隙分别降低了 0.1% 和 1.4%。

关键词

引用

@article{arxiv.2603.21050,
  title  = {ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition},
  author = {Zi Haur Pang and Xiaoxue Gao and Tatsuya Kawahara and Nancy F. Chen},
  journal= {arXiv preprint arXiv:2603.21050},
  year   = {2026}
}