JMI 在 SemEval 2024 任务 3 的参与:使用 GPT 上下文学习与指令微调 Llama 模型的多模态 ECAC 两步方法
计算与语言
2024-04-03 v2 机器学习
摘要
本文介绍了我们为 SemEval-2024 任务 3(“对话中的多模态情感原因分析竞赛”)开发的系统。在人类对话中有效捕捉情感需要整合文本、音频和视频等多种模态。然而,这些不同模态的复杂性为开发高效的多模态情感原因分析(ECA)系统带来了挑战。我们提出的方法通过两步框架应对这些挑战。我们在实现中采用了两种不同的方法。在方法 1 中,我们使用两个独立的 Llama 2 模型进行指令微调,分别用于情感预测和原因预测。在方法 2 中,我们使用 GPT-4V 进行对话级别的视频描述,并使用 GPT 3.5 对带有标注的对话进行上下文学习。我们的系统获得了第 4 名,系统消融实验表明我们提出的解决方案实现了显著的性能提升。所有实验代码均可在 Github 上获取。
引用
@article{arxiv.2403.04798,
title = {JMI at SemEval 2024 Task 3: Two-step approach for multimodal ECAC using in-context learning with GPT and instruction-tuned Llama models},
author = {Arefa and Mohammed Abbas Ansari and Chandni Saxena and Tanvir Ahmad},
journal= {arXiv preprint arXiv:2403.04798},
year = {2024}
}
备注
Paper Accepted at SemEval 2024