Emo-bias:面向语音情感识别的大规模社会偏差评估
音频与语音处理
2024-09-06 v2
摘要
语音情感识别(SER)的快速发展已在改善人机交互、辅助精神健康诊断等方面得到广泛应用。然而,SER模型可能包含对性别的社会偏见,导致不公平的结果。本研究大规模分析了基于自监督学习(SSL)训练的SER模型中的性别偏见,探讨影响其因素。选择基于SSL的SER模型作为研究对象,因为它们在该领域表现最为先进。我们的研究从上游模型和数据两个角度 pioneering性地研究了SER中的性别偏见。我们的发现表明,女性的整体SER性能略高于男性。两种著名的SSL模型,Modified CPC和 XLS-R,显著呈现出显著的偏见。此外,使用普通话数据集训练的模型显示出对价值情感的显著偏见。最后,我们发现训练数据中性别情感分布的差异对性别偏见具有显著影响,而上游模型的表示对性别偏见的影响有限。
引用
@article{arxiv.2406.05065,
title = {Emo-bias: A Large Scale Evaluation of Social Bias on Speech Emotion Recognition},
author = {Yi-Cheng Lin and Haibin Wu and Huang-Cheng Chou and Chi-Chun Lee and Hung-yi Lee},
journal= {arXiv preprint arXiv:2406.05065},
year = {2024}
}
备注
Accepted by INTERSPEECH 2024