中文

JMI 在 SemEval 2024 任务 3 的参与:使用 GPT 上下文学习与指令微调 Llama 模型的多模态 ECAC 两步方法

计算与语言 2024-04-03 v2 机器学习

摘要

本文介绍了我们为 SemEval-2024 任务 3(“对话中的多模态情感原因分析竞赛”)开发的系统。在人类对话中有效捕捉情感需要整合文本、音频和视频等多种模态。然而,这些不同模态的复杂性为开发高效的多模态情感原因分析(ECA)系统带来了挑战。我们提出的方法通过两步框架应对这些挑战。我们在实现中采用了两种不同的方法。在方法 1 中,我们使用两个独立的 Llama 2 模型进行指令微调,分别用于情感预测和原因预测。在方法 2 中,我们使用 GPT-4V 进行对话级别的视频描述,并使用 GPT 3.5 对带有标注的对话进行上下文学习。我们的系统获得了第 4 名,系统消融实验表明我们提出的解决方案实现了显著的性能提升。所有实验代码均可在 Github 上获取。

关键词

引用

@article{arxiv.2403.04798,
  title  = {JMI at SemEval 2024 Task 3: Two-step approach for multimodal ECAC using in-context learning with GPT and instruction-tuned Llama models},
  author = {Arefa and Mohammed Abbas Ansari and Chandni Saxena and Tanvir Ahmad},
  journal= {arXiv preprint arXiv:2403.04798},
  year   = {2024}
}

备注

Paper Accepted at SemEval 2024