ScImage:多模态大语言模型在科学文本到图像生成方面有多好?
人工智能
2024-12-04 v1 计算与语言
计算机视觉与模式识别
摘要
多模态大语言模型(LLMs)在从文本指令生成高质量图像方面已展现出惊人的能力。然而,其在生成科学图像——加速科学进步的关键应用——方面的表现尚未得到广泛探索。本文通过引入 ScImage,一个用于评估 LLMs 在从文本描述生成科学图像能力的基准测试,弥补了这一空白。ScImage 评估了三个关键理解维度:空间、数值和属性理解,以及它们的组合,专注于科学对象(如正方形、圆形)之间的关系。我们评估了五个模型:GPT-4o、Llama、AutomaTikZ、Dall-E 和 StableDiffusion,使用两种输出生成模式:基于代码的输出(Python、TikZ)和直接的栅格图像生成。此外,我们检查了四种不同的输入语言:英语、德语、波斯语和中文。我们的评估基于 11 位科学家,对三个标准(正确性、相关性和科学准确性)进行评审,结果显示尽管 GPT-4o 在涉及单个维度(如空间、数值或属性理解)的较简单提示下能产生相当质量的输出,但所有模型在这一任务中都面临挑战,尤其是对于更复杂的提示。
引用
@article{arxiv.2412.02368,
title = {ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?},
author = {Leixin Zhang and Steffen Eger and Yinjie Cheng and Weihe Zhai and Jonas Belouadi and Christoph Leiter and Simone Paolo Ponzetto and Fahimeh Moafian and Zhixue Zhao},
journal= {arXiv preprint arXiv:2412.02368},
year = {2024}
}