基于 t 分布的语音情感识别标签不确定性建模与预测
音频与语音处理
2022-07-26 v1 机器学习
声音
摘要
由于不同人对他人情绪表达的解读不同,其在唤醒度与效价方面的标注本身具有主观性。为此,这类情绪标注通常由多名标注者收集并跨标注者取平均,以获得唤醒度与效价的标签。然而,除平均值外,标签的不确定性同样值得关注,并应在自动情感识别中加以建模与预测。文献中出于简便,标签不确定性建模通常假设所收集的标注服从高斯分布。然而,由于资源限制,标注者数量通常较少,我们认为高斯方法是一种相当粗略的假设。相反,本工作中我们提出使用 Student's t 分布对标签分布建模,从而能够考虑可用标注的数量。基于该模型,我们推导出相应的 Kullback-Leibler 散度损失函数,并用其训练一个情绪标签分布估计器,从中可推断均值与不确定性。通过定性与定量分析,我们展示了 t 分布相对于高斯分布的优势。我们在 AVEC'16 数据集上验证了所提方法。结果表明,我们基于 t 分布的方法在语音情感识别中取得了优于高斯方法的当前最优不确定性建模结果,并具有更优甚至更快的收敛性。
引用
@article{arxiv.2207.12135,
title = {Label Uncertainty Modeling and Prediction for Speech Emotion Recognition using t-Distributions},
author = {Navin Raj Prabhu and Nale Lehmann-Willenbrock and Timo Gerkmann},
journal= {arXiv preprint arXiv:2207.12135},
year = {2022}
}
备注
ACCEPTED to ACII 2022 -10th INTERNATIONAL CONFERENCE ON AFFECTIVE COMPUTING & INTELLIGENT INTERACTION