基于注意力的语音情感识别感兴趣区域(ROI)检测
声音
2022-03-08 v1 机器学习
音频与语音处理
摘要
面向真实应用的自动情感识别是一项具有挑战性的任务。人类情感表达是微妙的,并可由多种情感的组合来传达。在多数现有情感识别研究中,每条语音/视频片段均被整体标注或分类。然而,语句/片段级标注与分类可能过于粗糙,难以捕捉语句/片段内细微的时间动态。例如,一条语音/视频片段通常仅包含少数情感显著区域与许多无情感区域。在本研究中,我们提出在深度循环神经网络中使用注意力机制来检测人类情感语音/视频中情感更显著的感兴趣区域(ROI),并通过聚合这些情感显著感兴趣区域进一步估计时间情感动态。我们比较并分析了来自音频与视频的 ROI。我们将所提注意力网络与最先进的 LSTM 模型在识别六种基本人类情感的多分类任务上的性能进行比较,所提注意力模型表现出显著更优的性能。此外,注意力权重分布可用于解释一条语句如何表达为可能情感的混合。
引用
@article{arxiv.2203.03428,
title = {Attention-based Region of Interest (ROI) Detection for Speech Emotion Recognition},
author = {Jay Desai and Houwei Cao and Ravi Shah},
journal= {arXiv preprint arXiv:2203.03428},
year = {2022}
}
备注
Paper written in 2019