中文

如何通过用户探索语音情感 AI 中的偏见?——基于年龄和语言偏见的语音情感-演员研究

人机交互 2025-07-18 v1

摘要

本研究探讨了年龄和语言如何塑造语音情感表达,聚焦于语音情感识别 (SER) 中的 underexplored 用户群体——12 名青少年和 12 名 55 岁以上的成年人。虽然大多数 SER 系统都在基于自发、单语英语数据上进行训练,但我们的研究评估了此类模型如何解释跨年龄群体和语言 (丹麦语和英语) 上的有意表达情感语音。为支持此目标,我们开发了一种新型实验范式,将定制用户界面与用于实时 SER 预测和数据记录的后端系统相结合。参与者被要求通过有意表达四种情感目标来命中情感空间中的视觉目标。尽管存在一些局限性,如依赖自行管理语音录音和任务执行不一致,但结果表明与预期相反,语言或年龄组之间没有显著差异,模型在跨语言和跨年龄方面表现出一定程度的鲁棒性。尽管在高 arousal 情感识别方面仍存在一些局限。我们的定性发现突显了超越系统中心准确性指标的必要性,呼吁采用更具包容性、以人为中心的 SER 模型。通过将情感表达视为目标导向行为并记录人类意图与机器解释之间的实时差距,我们揭示了情感错位的风险。

关键词

引用

@article{arxiv.2507.12580,
  title  = {"How to Explore Biases in Speech Emotion AI with Users?" A Speech-Emotion-Acting Study Exploring Age and Language Biases},
  author = {Josephine Beatrice Skovbo Borre and Malene Gorm Wold and Sara Kjær Rasmussen and Ilhan Aslan},
  journal= {arXiv preprint arXiv:2507.12580},
  year   = {2025}
}

备注

20 pages