中文

Milmer:一个基于多示例学习的多模态情绪识别框架

计算机视觉与模式识别 2025-02-04 v1 人工智能 人机交互

摘要

情绪在人类行为和决策中起着至关重要的作用,使得情绪识别成为人机交互(HCI)领域的一个关键研究方向。本研究通过将面部表情分析与脑电图(EEG)信号相结合,引入了一个新颖的多模态框架——Milmer,以应对情绪识别的挑战。所提出的框架采用基于 Transformer 的融合方法,有效整合视觉和生理模态。它由一个 EEG 预处理模块、一个面部特征提取与平衡模块以及一个跨模态融合模块组成。为了增强视觉特征提取,我们在情绪相关数据集上微调了一个预训练的 Swin Transformer。此外,引入了一种交叉注意力机制来平衡不同模态间的 Token 表示,确保有效的特征整合。本工作的一个关键创新是采用了多示例学习(MIL)方法,该方法从一段时间内的多张面部表情图像中提取有意义的信息,捕捉了以往研究中常被忽视的关键时间动态。在 DEAP 数据集上进行的大量实验证明了所提出框架的优越性,在四分类情绪识别任务中达到了 96.72% 的分类准确率。消融研究进一步验证了每个模块的贡献,突显了先进特征提取与融合策略在提升情绪识别性能方面的重要性。我们的代码可在 https://github.com/liangyubuaa/Milmer 获取。

关键词

引用

@article{arxiv.2502.00547,
  title  = {Milmer: a Framework for Multiple Instance Learning based Multimodal Emotion Recognition},
  author = {Zaitian Wang and Jian He and Yu Liang and Xiyuan Hu and Tianhao Peng and Kaixin Wang and Jiakai Wang and Chenlong Zhang and Weili Zhang and Shuang Niu and Xiaoyang Xie},
  journal= {arXiv preprint arXiv:2502.00547},
  year   = {2025}
}