用于对话情绪识别的解耦变分自编码器
计算与语言
2023-05-30 v1 声音
音频与语音处理
摘要
在对话情绪识别(ERC)中,目标话语的情绪与其上下文密切相关。因此,现有工作通过训练模型生成目标话语的回复,以利用上下文信息来识别情绪。然而,相邻回复生成忽略了长程依赖,且在许多情况下提供的情感信息有限。此外,大多数 ERC 模型为每个话语学习统一的分布式表示,缺乏可解释性与鲁棒性。为解决这些问题,我们提出一种 VAD 解耦变分自编码器(VAD-VAE),其首先基于变分自编码器引入目标话语重构任务,随后从潜空间中解耦出效价-唤醒度-支配度(VAD)三种情感表示。我们还通过引入来自情感词典的 VAD 监督信号并最小化 VAD 分布间的互信息来增强解耦表示。实验表明,VAD-VAE 在两个数据集上优于最先进的模型。进一步分析证明了各提出模块的有效性以及解耦 VAD 表示的质量。代码见 https://github.com/SteveKGYang/VAD-VAE。
引用
@article{arxiv.2305.14071,
title = {Disentangled Variational Autoencoder for Emotion Recognition in Conversations},
author = {Kailai Yang and Tianlin Zhang and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2305.14071},
year = {2023}
}
备注
Accepted by IEEE Transactions on Affective Computing