缓解多标签语音情感识别中的子群差异:一种伪标签与无监督学习方法
音频与语音处理
2025-06-02 v3 计算与语言
声音
摘要
尽管子群差异和性能偏差在计算研究中日益受到关注,但分类语音情感识别(SER)中的公平性仍鲜有探讨。现有方法通常依赖显式的人口统计标签,而由于隐私问题,这些标签难以获取。为解决这一局限性,我们引入了隐式人口统计推断(IDI)模块,该模块利用预训练模型的伪标签和基于 k-means 聚类的无监督学习来缓解 SER 中的偏差。我们的实验表明,伪标签 IDI 减少了子群差异,在 SER 准确率下降不到 2% 的情况下,将公平性指标提高了 28% 以上。此外,无监督 IDI 在公平性指标上取得了 4.6% 以上的提升,而 SER 性能下降不到 3.6%。进一步分析表明,无监督 IDI 能持续缓解种族和年龄差异,证明了其在显式人口统计信息不可用时具有潜力。
引用
@article{arxiv.2505.14449,
title = {Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach},
author = {Yi-Cheng Lin and Huang-Cheng Chou and Hung-yi Lee},
journal= {arXiv preprint arXiv:2505.14449},
year = {2025}
}
备注
Accepted by InterSpeech 2025. 7 pages including 2 pages of appendix