中文

面向不完整数据场景下多模态情绪识别的抗噪声联合表示学习

计算机视觉与模式识别 2024-09-20 v3 人工智能 机器学习

摘要

实际场景中的多模态情绪识别(MER)因各模态存在缺失或不完整数据而面临显著挑战。为克服这些挑战,研究者致力于在训练阶段模拟不完整条件以增强系统整体鲁棒性。传统方法常涉及丢弃数据或以零向量替换数据段来近似这些不完整性。然而,此类方法既不能准确表征真实世界状况,也无法充分解决噪声数据可用性问题。例如,模糊图像不能被简单替换为零向量,同时仍保留信息。为解决该问题并开发更精确的 MER 系统,我们引入一种新颖的抗噪声 MER 模型,可从噪声数据中有效学习鲁棒的多模态联合表示。该方法包含两个关键组件:其一,一个噪声调度器,调整数据中的噪声类型与程度以模拟各种现实不完整情形;其二,采用基于变分自编码器(VAE)的模块从噪声输入中重建这些鲁棒多模态联合表示。值得注意的是,噪声调度器的引入使得探索一种全新的不完整数据类型成为可能,而这是现有方法无法实现的。在基准数据集 IEMOCAP 与 CMU-MOSEI 上的大量实验评估证明了噪声调度器的有效性及我们所提模型的优异性能。我们的项目公开于 https://github.com/WooyoohL/Noise-robust_MER。

关键词

引用

@article{arxiv.2311.16114,
  title  = {Learning Noise-Robust Joint Representation for Multimodal Emotion Recognition under Incomplete Data Scenarios},
  author = {Qi Fan and Haolin Zuo and Rui Liu and Zheng Lian and Guanglai Gao},
  journal= {arXiv preprint arXiv:2311.16114},
  year   = {2024}
}

备注

Accepted by MRAC@ACM Multimedia 2024