中文

跨语言语音情感识别:人类与自监督模型之比较

音频与语音处理 2025-05-01 v2 人工智能 计算与语言 人机交互 声音

摘要

利用自监督学习 (SSL) 模型进行语音情感识别 (SER) 已被证明是有效的,但针对跨语言场景的研究仍然有限。本研究对人类表现与 SSL 模型进行了比较分析,首先进行逐层分析,并在单语、跨语言和迁移学习语境下探索参数高效微调策略。我们进一步在话语级和片段级比较模型与人类的 SER 能力。此外,我们通过人工评估研究了方言对跨语言 SER 的影响。研究结果表明,通过适当的知识迁移,模型能够适应目标语言,并达到与母语者相当的表现。我们还证明了方言对缺乏语言学和副语言学背景个体的 SER 具有显著影响。此外,人类和模型在不同情感上表现出截然不同的行为。这些结果为 SSL 模型的跨语言 SER 能力提供了新见解,强调了其与人类情感感知的相似性与差异性。

关键词

引用

@article{arxiv.2409.16920,
  title  = {Cross-Lingual Speech Emotion Recognition: Humans vs. Self-Supervised Models},
  author = {Zhichen Han and Tianqi Geng and Hui Feng and Jiahong Yuan and Korin Richmond and Yuanchao Li},
  journal= {arXiv preprint arXiv:2409.16920},
  year   = {2025}
}

备注

Accepted to ICASSP 2025