用于语音情感分类的情感轮廓精炼法
音频与语音处理
2020-08-13 v1 声音
摘要
人类情感本质上具有模糊性与不纯性。在设计基于语音预判人类情感的系统时,必须考虑情感纯度的缺失。然而,当前大多数语音情感分类方法依赖于一致性假设,例如对一条语音仅给出一个硬标签。考虑到情感不纯性,该标注原则给系统性能带来了挑战。本文推荐使用情感轮廓(EPs),其提供一段段级软标签的时间序列,以捕捉特定语音话语中存在的细微情感线索混合。我们进一步提出情感轮廓精炼(EPR),一种迭代更新EPs的流程。EPR方法在连续的精炼阶段中产生软的、动态生成的多重概率类标签,从而显著提升了模型准确率。在三个知名情感语料库上的实验显示了所提方法的明显增益。
引用
@article{arxiv.2008.05259,
title = {Emotion Profile Refinery for Speech Emotion Classification},
author = {Shuiyang Mao and P. C. Ching and Tan Lee},
journal= {arXiv preprint arXiv:2008.05259},
year = {2020}
}