中文

基于不完整模态的联邦对话-语义扩散情感识别

计算机视觉与模式识别 2025-11-04 v1

摘要

多模态情感识别在对话中(MERC)通过融合多模态信号来增强情感理解。然而,现实场景中不可预测的模态缺失显著降低了现有方法的性能。依赖完整多模态数据进行训练的常规缺失模态恢复方法在极端数据分布下(如固定模态缺失)常常 suffer from 语义失真。为此,我们提出 Federated Dialogue-guided and Semantic-Consistent Diffusion(FedDISC)框架,首次将联邦学习引入缺失模态恢复。通过对在各客户端上训练的模态特定扩散模型进行联邦聚合并将其广播给缺失相应模态的客户端,FedDISC 克服了单客户端对模态完整性的依赖。此外,DISC-Diffusion 模块确保在恢复模态与可用模态之间在语境、说话人身份和语义方面的一致性,通过 Dialogue Graph Network 捕获对话依赖性和 Semantic Conditioning Network 实现语义对齐。我们进一步引入一种 novel Alternating Frozen Aggregation 策略,循环冻结恢复和分类模块以促进协同优化。广泛的在 IEMOCAP、CMUMOSI 和 CMUMOSEI 数据集上的实验表明,FedDISC 在各种缺失模态模式下实现了优异的情感分类性能,超越了现有方法。

关键词

引用

@article{arxiv.2511.00344,
  title  = {Federated Dialogue-Semantic Diffusion for Emotion Recognition under Incomplete Modalities},
  author = {Xihang Qiu and Jiarong Cheng and Yuhao Fang and Wanpeng Zhang and Yao Lu and Ye Zhang and Chun Li},
  journal= {arXiv preprint arXiv:2511.00344},
  year   = {2025}
}