中文

MaterialBENCH:评估大语言模型的大学材料科学问题求解能力

计算与语言 2024-12-02 v2 材料科学

摘要

本文构建了一个面向材料科学领域大语言模型(LLM)的大学水平基准数据集 MaterialBENCH。该数据集由基于大学教材的问答对组成。问题分为两种类型:一种是自由回答型,另一种是多项选择题型。多项选择题通过在一个正确答案中添加三个错误答案作为选项来构建,以便 LLM 从四个选项中选择一个作为回答。除了答案格式不同外,自由回答型和多项选择题型的大多数问题是重叠的。我们还在 LLM 上使用 MaterialBENCH 进行了实验,包括 ChatGPT-3.5、ChatGPT-4、Bard(在实验时)以及使用 OpenAI API 的 GPT-3.5 和 GPT-4。分析并讨论了由 MaterialBENCH 测得的 LLM 性能的差异与相似之处。还研究了同一模型在自由回答型和多项选择题型之间的性能差异,以及使用系统消息对多项选择题的影响。我们预期 MaterialBENCH 将鼓励 LLM 在解决更复杂问题的推理能力方面取得进一步发展,并最终为材料研究与发现做出贡献。

关键词

引用

@article{arxiv.2409.03161,
  title  = {MaterialBENCH: Evaluating College-Level Materials Science Problem-Solving Abilities of Large Language Models},
  author = {Michiko Yoshitake and Yuta Suzuki and Ryo Igarashi and Yoshitaka Ushiku and Keisuke Nagato},
  journal= {arXiv preprint arXiv:2409.03161},
  year   = {2024}
}