中文

基于标签方差建模语音情感并分析跨说话人及未见声学条件下的表现

声音 2025-04-01 v1 人工智能 机器学习 音频与语音处理

摘要

自发语音情感数据通常包含感知评分,评估者在倾听语音文件后会赋值情感分数。此类感知评分因评估者意见差异引入标签不确定性。通过采用共识评分作为基准标签来处理评估者差异,其中选择情感得分最高者。但共识评分未能考虑含有多重情感的模糊实例,这些实例通过评估者意见不确定性得以捕捉。我们证明,使用情感评分概率密度函数作为目标(相较于文献中常用的共识评分)可在基准评估集上实现更佳性能。我们展示,利用显著性驱动的基础模型(FM)表示选择有助于训练一种用于维度和类别情感识别的前沿语音情感模型。通过比较来自不同FM的表示,我们发现仅关注整体测试集性能会误导,因为它未能揭示模型在说话人和性别上的泛化能力。我们进一步证明,跨多个测试集的性能评估以及按性别和说话人的性能分析对于评估情感模型的实用性具有重要作用。最后,我们展示,标签不确定性和数据偏斜对模型评估构成挑战,与其使用最佳假设,不如考虑前2或3名假设。

关键词

引用

@article{arxiv.2503.22711,
  title  = {Modeling speech emotion with label variance and analyzing performance across speakers and unseen acoustic conditions},
  author = {Vikramjit Mitra and Amrit Romana and Dung T. Tran and Erdrin Azemi},
  journal= {arXiv preprint arXiv:2503.22711},
  year   = {2025}
}

备注

11 pages, 5 figures