基于 ASR 的特征用于情感识别:一种迁移学习方法
音频与语音处理
2018-06-04 v3 人工智能
计算与语言
声音
摘要
在过去十年中,深度学习使信号处理应用得到了极大改进。然而,情感计算领域如情感语音合成或从口语中识别情感仍然具有挑战性。本文研究了使用神经自动语音识别(ASR)作为情感识别的特征提取器。我们表明,这些特征在预测效价和唤醒情感维度上优于 eGeMAPS 特征集,这意味着 ASR 系统学习的音频到文本映射包含了自发表语音中情感维度的相关信息。我们还考察了 ASR 的靠近语音的前几层与靠近文本的后几层同效价/唤醒之间的关系。
引用
@article{arxiv.1805.09197,
title = {ASR-based Features for Emotion Recognition: A Transfer Learning Approach},
author = {Noé Tits and Kevin El Haddad and Thierry Dutoit},
journal= {arXiv preprint arXiv:1805.09197},
year = {2018}
}
备注
Accepted to be published in the First Workshop on Computational Modeling of Human Multimodal Language - ACL 2018