利用声学属性提示描述情绪以进行语音情感识别
声音
2022-11-16 v1 机器学习
音频与语音处理
摘要
情绪处于一个广阔的连续体中,而将情绪视为离散的若干类别限制了模型捕捉该连续体中细微差别的能力。挑战在于如何描述情绪的细微差别,以及如何使模型学习这些描述。在本工作中,我们设计了一种方法,通过计算机音高、响度、语速和发音速率等声学属性,为给定音频自动生成描述(或提示)。我们使用 5 个不同的情绪数据集将提示与其对应音频配对,并利用这些音频-文本对训练了一个神经网络模型。随后,我们使用另一个数据集对模型进行评估。我们探究了模型如何学习将音频与描述相关联,从而提升了语音情感识别与语音音频检索的性能。我们期望我们的发现能够激励描述情绪广阔连续体的相关研究。
引用
@article{arxiv.2211.07737,
title = {Describing emotions with acoustic property prompts for speech emotion recognition},
author = {Hira Dhamyal and Benjamin Elizalde and Soham Deshmukh and Huaming Wang and Bhiksha Raj and Rita Singh},
journal= {arXiv preprint arXiv:2211.07737},
year = {2022}
}