中文

利用 SVM 融合声学与文本网络预测的两阶段维度情感识别

声音 2022-10-27 v1 音频与语音处理

摘要

计算机自动语音情感识别(SER)是实现更自然人机交互的关键组成部分。如同人与人之间的交互,正确感知情感的能力对于在特定情境下采取进一步行动至关重要。SER 中的一个问题是是否有必要将声学特征与面部表情、文本以及动作捕捉等其他数据相结合。本研究提出通过采用包含两步的后融合方法来结合声学与文本信息。首先,在深度学习系统中分别训练声学与文本特征。其次,将深度学习系统的预测结果输入支持向量机(SVM),以预测最终的回归得分。此外,本研究采用维度情感建模,因为它能够实现对情感状态更深入的分析。实验结果表明,这种两阶段后融合方法获得了比任何单阶段处理更高的性能,且从单阶段到两阶段处理呈现线性相关性。以一致性相关系数得分衡量,该后融合方法改进了先前的早期融合结果。

关键词

引用

@article{arxiv.2210.14495,
  title  = {Two-stage dimensional emotion recognition by fusing predictions of acoustic and text networks using SVM},
  author = {Bagus Tris Atmaja and Masato Akagi},
  journal= {arXiv preprint arXiv:2210.14495},
  year   = {2022}
}

备注

Published in Speech Communications