中文

基于视觉语言提示和模态丢弃的多模态情感识别

计算机视觉与模式识别 2024-09-12 v1 人工智能

摘要

本文介绍了我们为第二届多模态情感识别挑战赛轨道1(MER2024-SEMI)所提出的解决方案。为增强情感识别的准确度和泛化性能,我们提出了几种方法。首先,我们引入EmoVCLIP,这是一个基于CLIP进行视觉语言提示学习微调的模型,专为视频基情感识别任务设计。通过对CLIP进行提示学习,EmoVCLIP改进了预训练CLIP在情感视频上的性能。此外,为解决多模态融合中的模态依赖问题,我们采用模态丢弃进行稳健信息融合。 Furthermore, 为了帮助Baichuan更好地提取情感信息,我们建议使用GPT-4作为Baichuan的提示。最后,我们利用自训练策略来利用未标记的视频。在此过程中,我们使用我们模型生成的高置信度伪标签的未标记视频,并将其纳入训练集。实验结果表明,我们的模型在MER2024-SEMI轨道中名列第1,测试集准确率达到90.15%。

关键词

引用

@article{arxiv.2409.07078,
  title  = {Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout},
  author = {Anbin QI and Zhongliang Liu and Xinyong Zhou and Jinba Xiao and Fengrun Zhang and Qi Gan and Ming Tao and Gaozheng Zhang and Lu Zhang},
  journal= {arXiv preprint arXiv:2409.07078},
  year   = {2024}
}