中文

科学推理:多模态生成式大型语言模型的评估

计算与语言 2025-03-04 v1 人工智能 计算机视觉与模式识别

摘要

大型语言模型(LLM)可以回答问题并推理复杂任务,包括来自科学领域的任务。我们在 ScienceQA 上评估了几个多模态大型语言模型(MLLM),发现 Gemini 模型在少量上下文时表现最高,在丰富上下文时与人类解释的文本相似度最高。对较小的 MLLM 进行适配器调优未能带来可靠的性能提升。从 Gemini 输出进行训练的成绩不如从原始数据进行训练。

关键词

引用

@article{arxiv.2503.01064,
  title  = {Scientific Reasoning: Assessment of Multimodal Generative LLMs},
  author = {Florian Dreyer and Ekaterina Kolos and Daria Matiash},
  journal= {arXiv preprint arXiv:2503.01064},
  year   = {2025}
}