中文

非典型语音的情感模型表现较差

机器学习 2025-08-01 v2

摘要

语音和声音条件会改变语音的声学特性,这可能影响面向语音情感的模型性能。我们评估了可公开获取的模型在非典型语音数据集上对识别类别情感和维度情感的效果,并将结果与典型语音数据集进行比较。我们检验了三种语音非典型性维度:可理解性(与发音相关)、单音调(与韵律相关)和粗糙度(与声音质量相关)。我们关注 (1) 类别情感预测在数据集中的分布趋势,(2) 类别情感预测的分布比较与类似的典型语音数据集,以及 (3) 文本与语音预测之间的相关性强度对于自发语音中的 valence 和 arousal。我们发现,情感模型的输出显著受到语音非典型性的存在及其程度的影响。例如,所有类型和程度的非典型语音相对于类似的典型语音数据集,被预测为悲伤的语音比例显著更高。在对提高非典型语音鲁棒性进行的初步调查中,我们发现,使用伪标记的非典型语音数据进行微调可在不影响典型语音性能的情况下提高在非典型语音上的性能。我们的结果强调需要更广泛的语音情感模型训练和评估数据集,以及对语音差异具有鲁棒性的建模方法。

关键词

引用

@article{arxiv.2504.16283,
  title  = {Affect Models Have Weak Generalizability to Atypical Speech},
  author = {Jaya Narain and Amrit Romana and Vikramjit Mitra and Colin Lea and Shirley Ren},
  journal= {arXiv preprint arXiv:2504.16283},
  year   = {2025}
}

备注

Preprint