中文

MM-PhyQA:基于多图像思维链提示的多模态物理问答

计算与语言 2024-04-16 v1 人工智能

摘要

尽管大语言模型(LLM)在各种任务中可以达到人类水平的表现,但在有效处理多步骤物理推理任务时仍然面临挑战。为了识别现有模型的不足并促进该领域的进一步研究,我们整理了一个新颖的数据集MM-PhyQA,其中包含精心构建的高中水平多模态物理问题。通过评估当前公开可用的LLM在包含和不包含多模态元素的情况下的性能,我们旨在揭示其能力。为了生成包含多模态输入(本例中为图像和文本)的问题答案,我们使用GPT-4进行零样本预测,并利用LLaVA(LLaVA和LLaVA-1.5),后者在我们的数据集上进行了微调。为了评估仅包含文本输入的LLM的性能,我们测试了Mistral-7B和LLaMA2-7b模型的基础版本和微调版本。我们还展示了新颖的多图像思维链(MI-CoT)提示技术的性能,该技术用于训练LLaVA-1.5 13b时,在我们的数据集上取得了最佳结果,在大多数指标上得分优异,并在测试集上达到了71.65%的最高准确率。

关键词

引用

@article{arxiv.2404.08704,
  title  = {MM-PhyQA: Multimodal Physics Question-Answering With Multi-Image CoT Prompting},
  author = {Avinash Anand and Janak Kapuriya and Apoorv Singh and Jay Saraf and Naman Lal and Astha Verma and Rushali Gupta and Rajiv Shah},
  journal= {arXiv preprint arXiv:2404.08704},
  year   = {2024}
}