用于语音情感预测的注意力增强端到端多任务学习
计算与语言
2019-04-01 v1 机器学习
摘要
尽管端到端学习系统在语音情感识别中的研究兴趣日益增长,传统系统要么因训练数据有限等原因遭受过拟合,要么未显式考虑自动学习表征对特定任务的不同贡献。在本文中,我们提出了一种新颖的端到端框架,其通过其他辅助任务与注意力机制的学习得到增强。即,我们将一个端到端网络与若干不同但相关的情感预测任务(即唤醒度、效价与支配度预测)联合训练,以提取比传统系统更具鲁棒性且为各任务共享的表征,期望借此缓解过拟合问题。同时,在每个任务的各层之上实现注意力层,旨在捕捉不同片段部分对每个独立任务的贡献分布。为评估所提系统的有效性,我们在广泛使用的IEMOCAP数据库上进行了一组实验。实证结果表明所提系统显著优于相应的基线系统。
引用
@article{arxiv.1903.12424,
title = {Attention-Augmented End-to-End Multi-Task Learning for Emotion Prediction from Speech},
author = {Zixing Zhang and Bingwen Wu and Bjoern Schuller},
journal= {arXiv preprint arXiv:1903.12424},
year = {2019}
}
备注
accepted by ICASSP 2019