中文

桥接语音情感识别与人格特质:数据集与时序互动条件网络

声音 2025-12-01 v2 音频与语音处理

摘要

本研究探讨了人格特质与情感表达之间的相互作用,探索人格信息如何改善语音情感识别 (SER)。我们为 IEMOCAP 数据集收集了人格标注,使其成为首个同时包含情感和人格标注的数据集 (PA-IEMOCAP),并使人格特质能够直接集成到 SER 中。该数据集上的统计分析识别出人格特质与情感表达之间存在显著相关性。为提取细粒度的人格特征,我们提出了时序互动条件网络 (TICN),其中将人格特征与基于 HuBERT 的声学特征集成用于 SER。实验表明,纳入真实人格特质显著提升了价值情感识别性能,将一致性相关系数 (CCC) 从 0.698 提升至 0.785。对于在对话系统中用户人格信息不可用的实际应用场景,我们开发了一个基于自动人格识别的前端模块。使用这些自动预测的特质作为我们提出的 TICN 模型的输入,我们实现了价值情感识别的 CCC 为 0.776,相对于基线实现了 11.17% 的相对提升。这一发现确认了人格感知 SER 的有效性,并为进一步探索人格感知语音处理应用奠定了坚实基础。

关键词

引用

@article{arxiv.2505.13978,
  title  = {Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network},
  author = {Yuan Gao and Hao Shi and Yahui Fu and Chenhui Chu and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2505.13978},
  year   = {2025}
}