通过聚焦与校准注意力机制改进语音情感识别
声音
2022-08-24 v1 人工智能
机器学习
音频与语音处理
摘要
注意力已成为深度学习方法中最常用的机制之一。注意力机制可帮助系统更多地聚焦于特征空间的关键区域。例如,高振幅区域对语音情感识别 (SER) 具有重要作用。在本文中,我们识别出已有多头自注意力中注意力与信号振幅之间的错位。为改进注意力区域,我们提出将聚焦注意力 (FA) 机制与一种新颖的校准注意力 (CA) 机制结合多头自注意力使用。通过 FA 机制,网络可检测片段中最大振幅部分。借助 CA 机制,网络可通过为各注意力头分配不同权重来调节信息流,并改善对周边上下文的利用。为评估所提方法,使用 IEMOCAP 与 RAVDESS 数据集进行了实验。实验结果表明,所提框架在这两个数据集上均显著优于最先进方法。
引用
@article{arxiv.2208.10491,
title = {Improving Speech Emotion Recognition Through Focus and Calibration Attention Mechanisms},
author = {Junghun Kim and Yoojin An and Jihie Kim},
journal= {arXiv preprint arXiv:2208.10491},
year = {2022}
}
备注
Accepted by INTERSPEECH 2022