科学推理:多模态生成式大型语言模型的评估
计算与语言
2025-03-04 v1 人工智能
计算机视觉与模式识别
摘要
大型语言模型(LLM)可以回答问题并推理复杂任务,包括来自科学领域的任务。我们在 ScienceQA 上评估了几个多模态大型语言模型(MLLM),发现 Gemini 模型在少量上下文时表现最高,在丰富上下文时与人类解释的文本相似度最高。对较小的 MLLM 进行适配器调优未能带来可靠的性能提升。从 Gemini 输出进行训练的成绩不如从原始数据进行训练。
引用
@article{arxiv.2503.01064,
title = {Scientific Reasoning: Assessment of Multimodal Generative LLMs},
author = {Florian Dreyer and Ekaterina Kolos and Daria Matiash},
journal= {arXiv preprint arXiv:2503.01064},
year = {2025}
}