用于多模态情感识别的基于注意力双向对齐的组门控融合
计算与语言
2022-01-19 v1 声音
音频与语音处理
摘要
情感识别是一个具有挑战性且活跃的研究领域,在具备情感感知的人机交互系统中起着关键作用。在多模态场景下,不同模态间的时间对齐尚未得到充分研究。本文提出一种名为门控双向对齐网络(GBAN)的新模型,其包含一个基于注意力的LSTM隐藏态双向对齐网络以显式捕捉语音与文本间的对齐关系,以及一种新颖的组门控融合(GGF)层来整合不同模态的表示。我们通过实验表明,注意力对齐表示显著优于LSTM的最后隐藏态,且所提GBAN模型在IEMOCAP数据集上优于现有的最先进多模态方法。
引用
@article{arxiv.2201.06309,
title = {Group Gated Fusion on Attention-based Bidirectional Alignment for Multimodal Emotion Recognition},
author = {Pengfei Liu and Kun Li and Helen Meng},
journal= {arXiv preprint arXiv:2201.06309},
year = {2022}
}
备注
Published in INTERSPEECH-2020