面向情感识别的域对抗学习
音频与语音处理
2019-10-31 v1 机器学习
声音
摘要
在情感识别的实际应用中,用户并非总存在于训练语料中。训练说话人与测试说话人之间的不匹配会影响所训练模型的性能。为解决该问题,我们需要模型聚焦于与情感相关的信息,同时忽略说话人身份之间的差异。本文研究了利用域对抗神经网络(DANN)来提取不同说话人之间的公共表示。主任务为预测情感标签,辅任务为学习一个无法区分说话人身份的公共表示。通过使用梯度反转层,来自辅任务的梯度被用于拉近不同说话人的表示。为验证所提方法的有效性,我们在IEMOCAP数据库上进行了实验。实验结果表明,所提框架相较最先进策略取得了3.48%的绝对提升。
引用
@article{arxiv.1910.13807,
title = {Domain adversarial learning for emotion recognition},
author = {Zheng Lian and Jianhua Tao and Bin Liu and Jian Huang},
journal= {arXiv preprint arXiv:1910.13807},
year = {2019}
}
备注
submitted to ICASSP2020