基于视觉语言提示和模态丢弃的多模态情感识别
计算机视觉与模式识别
2024-09-12 v1 人工智能
摘要
本文介绍了我们为第二届多模态情感识别挑战赛轨道1(MER2024-SEMI)所提出的解决方案。为增强情感识别的准确度和泛化性能,我们提出了几种方法。首先,我们引入EmoVCLIP,这是一个基于CLIP进行视觉语言提示学习微调的模型,专为视频基情感识别任务设计。通过对CLIP进行提示学习,EmoVCLIP改进了预训练CLIP在情感视频上的性能。此外,为解决多模态融合中的模态依赖问题,我们采用模态丢弃进行稳健信息融合。 Furthermore, 为了帮助Baichuan更好地提取情感信息,我们建议使用GPT-4作为Baichuan的提示。最后,我们利用自训练策略来利用未标记的视频。在此过程中,我们使用我们模型生成的高置信度伪标签的未标记视频,并将其纳入训练集。实验结果表明,我们的模型在MER2024-SEMI轨道中名列第1,测试集准确率达到90.15%。
引用
@article{arxiv.2409.07078,
title = {Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout},
author = {Anbin QI and Zhongliang Liu and Xinyong Zhou and Jinba Xiao and Fengrun Zhang and Qi Gan and Ming Tao and Gaozheng Zhang and Lu Zhang},
journal= {arXiv preprint arXiv:2409.07078},
year = {2024}
}