用于对话情绪识别的多模态提示 Transformer 与混合对比学习
计算与语言
2023-10-10 v1 声音
音频与语音处理
摘要
对话情绪识别(Emotion Recognition in Conversation, ERC)在推动人机交互发展中起着重要作用。情绪可存在于多种模态中,多模态 ERC 主要面临两个问题:(1) 跨模态信息融合过程中的噪声问题,以及 (2) 语义相似但类别不同的少样本情绪标签的预测问题。为解决这些问题并充分利用各模态特征,我们采取以下策略:首先,对表示能力强的模态进行深度情绪线索提取,并将特征过滤器设计为表示能力弱模态的多模态提示信息。然后,我们设计多模态提示 Transformer (Multimodal Prompt Transformer, MPT) 来执行跨模态信息融合。MPT 将多模态融合信息嵌入 Transformer 的每一注意力层,使提示信息参与文本特征编码并与多级文本信息融合以获得更好的多模态融合特征。最后,我们使用混合对比学习(Hybrid Contrastive Learning, HCL)策略优化模型处理少样本标签的能力。该策略利用无监督对比学习提升多模态融合的表示能力,并利用有监督对比学习挖掘少样本标签的信息。实验结果表明,在两个基准数据集上,我们提出的模型在 ERC 上优于最先进(state-of-the-art, SOTA)模型。
引用
@article{arxiv.2310.04456,
title = {Multimodal Prompt Transformer with Hybrid Contrastive Learning for Emotion Recognition in Conversation},
author = {Shihao Zou and Xianying Huang and Xudong Shen},
journal= {arXiv preprint arXiv:2310.04456},
year = {2023}
}
备注
Accepted to ACM MM 2023