通过因果扩散桥接的多模态情感识别 (Affect-Diff)
计算机视觉与模式识别
2026-05-12 v1
摘要
CMU-MOSEI 上的多模态情感识别面临极端不平衡问题:Happy 占样本的 65.9%,而三个 Ekman 类别共计代表不到 7%,导致标准融合模型通过忽略少数情感类别来最大化准确率。我们提出了 Affect-Diff,一个因果扩散桥接 (Causal-Diffusion Bridge),通过三个联合训练的机制来解决这一问题:一个 NOTEARS 学习的因果图在融合前重新加权模态贡献,一个 beta-VAE 瓶颈用于正则化潜空间压缩,以及一个停止梯度的 1D DDPM 先验,用于在多数类崩溃下结构化潜空间。在 3292 个对齐的 CMU-MOSEI 样本上,Affect-Diff 实现了验证平衡准确率 0.384,相对于最强基线 (TETFN: 0.324) 提升了 18%,而所有评估的基线在 Fear、Disgust 和 Surprise 上都产生零 F1。消融研究确认扩散先验 (-24%) 和因果图 (-13%) 的独立、非冗余贡献。值得注意的是,仅确定性编码器变体检测到了所有六个情感类别,揭示了 KL 正则化强度作为少数类灵敏度的直接杠杆。
引用
@article{arxiv.2605.08252,
title = {Multimodal Emotion Recognition via Causal-Diffusion Bridge (Affect-Diff)},
author = {Ankit Sanjyal},
journal= {arXiv preprint arXiv:2605.08252},
year = {2026}
}
备注
10 Pages, 12 Figures, 6 Tables