中文

GSDNet:从图谱视角重新审视不完整多模态扩散以实现对话情感识别

声音 2025-06-17 v1 计算与语言 音频与语音处理

摘要

对话中的多模态情感识别(MERC)旨在通过分析来自多个来源(即视频、音频和文本)的语句信息来推断说话者的情感状态。与单模态相比,通过融合来自不同模态的互补语义信息可以获得更鲁棒的语句表示。然而,模态缺失问题严重限制了 MERC 在实际场景中的性能。近期工作在图神经网络和扩散模型两个维度上分别取得了在模态补全方面的令人瞩目的成绩。这启发我们通过图扩散模型将这两个维度结合起来,以获得更强的模态恢复能力。不幸的是,现有的图扩散模型可能通过直接向邻接矩阵添加高斯噪声来破坏图的连通性和局部结构,导致生成的图数据无法保留原始图的语义和拓扑信息。为此,我们提出了一种新颖的图谱扩散网络(GSDNet),它将高斯噪声映射到缺失模态的图谱空间,并根据其原始分布恢复缺失数据。与之前的图扩散方法相比,GSDNet 仅影响邻接矩阵的特征值而非直接破坏邻接矩阵,从而可以在扩散过程中保持全局拓扑信息和重要的谱特征。大量实验已证明 GSDNet 在各种模态缺失场景下实现了最先进的情感识别性能。

关键词

引用

@article{arxiv.2506.12325,
  title  = {GSDNet: Revisiting Incomplete Multimodal-Diffusion from Graph Spectrum Perspective for Conversation Emotion Recognition},
  author = {Yuntao Shou and Jun Yao and Tao Meng and Wei Ai and Cen Chen and Keqin Li},
  journal= {arXiv preprint arXiv:2506.12325},
  year   = {2025}
}