中文

从并行神经网络中学习鲁棒异构信号特征用于音频情感分析

音频与语音处理 2019-08-01 v2 计算与语言 声音

摘要

音频情感分析是一个热门研究领域,它将传统的基于文本的情感分析扩展为依赖于从语音中提取的声学特征的有效性。然而,当前音频情感分析的进展主要集中在提取同质声学特征,或未能有效融合异构特征。本文中,我们提出一种基于语句的深度神经网络模型,其由卷积神经网络(CNN)与基于长短期记忆(LSTM)的网络并行组合而成,用以获取称为音频情感向量(ASV)的代表性特征,该特征能最大限度反映音频中的情感信息。具体而言,我们的模型以语句级标签进行训练,ASV可从两个分支中创造性提取并融合。在CNN模型分支中,由信号生成的频谱图作为 inputs 输入;而在LSTM模型分支中,输入包括从音频中相依语句提取的谱特征与倒谱系数。此外,采用带注意力机制的双向长短期记忆(BiLSTM)进行特征融合。我们进行了大量实验,表明我们的模型能精准且快速地识别音频情感,并证明我们的ASV优于传统声学特征或其他深度学习模型提取的向量。进一步,实验结果表明,所提模型在Multimodal Opinion-level Sentiment Intensity dataset(MOSI)数据集上以9.33%的优势超越最先进方法。

关键词

引用

@article{arxiv.1811.08065,
  title  = {Learning Robust Heterogeneous Signal Features from Parallel Neural Network for Audio Sentiment Analysis},
  author = {Feiyang Chen and Ziqian Luo},
  journal= {arXiv preprint arXiv:1811.08065},
  year   = {2019}
}

备注

21 pages, PR JOURNAL