基于图的多特征融合方法用于语音情感识别
声音
2024-06-14 v2 音频与语音处理
摘要
探索合理的方式进行跨语料库语音情感识别的多语音特征融合至关重要,因为不同语音特征可能提供互补线索以反映人类情感状态。虽然大多数先前方法仅提取单一语音特征用于情感识别,但现有融合方法(如拼接、平行连接、拼接)忽略了特征与特征之间异构模式的相互作用,导致现有系统性能受限。本文提出一种新颖的基于图的融合方法,以显式建模每个语音特征对每个语音特征的关系。具体而言,我们提出了一种称为语音情感识别的基于图的多特征融合方法的多维边特征学习策略。它将每个语音特征表示为节点,并学习多维边特征以在情感识别语境中显式描述每个特征-特征对的关系。如此一来,所学的多维边特征从顶点和边维度编码了语音特征层次信息。我们的方法由三个模块组成:音频特征生成(AFG)模块、音频-特征多维边特征(AMEF)模块和语音情感识别(SER)模块。该方法在SEWA 数据集上取得满意结果。此外,该方法在AVEC 2019 工作坊和挑战赛中显示出优于基线的提升性能。我们使用来自两种文化的数据作为训练和验证集:SEWA 数据集中的德国和匈牙利文化,德国文化的 arousal 和 liking 分别提高了17.28%和7.93%。该方法的结果在各种替代融合技术中实现了13%的性能提升,包括采用单维边特征融合方法的技术。
引用
@article{arxiv.2406.07437,
title = {Graph-based multi-Feature fusion method for speech emotion recognition},
author = {Xueyu Liu and Jie Lin and Chao Wang},
journal= {arXiv preprint arXiv:2406.07437},
year = {2024}
}
备注
25 pages,4 figures