中文

MaScQA:用于考察大语言模型材料科学知识的问答数据集

计算与语言 2023-08-21 v1 材料科学

摘要

从材料文献中抽取信息和进行文本理解对于建立详尽的知识库以加速材料发现至关重要。语言模型已展现出回答领域特定问题和从知识库中检索信息的能力。然而,材料领域尚无能够评估这些语言模型对关键概念理解的基准数据集。在本工作中,我们整理了一个包含 650 道具有挑战性问题的材料领域数据集,这些问题需要已获得学士学位的材料专业学生所具备的知识与技能。我们基于问题结构及材料科学领域子类别对这些问题进行分类。进一步,我们通过零样本和思维链提示评估了 GPT-3.5 和 GPT-4 模型解答这些问题的表现。观察到 GPT-4 相较 GPT-3.5 给出了最佳表现(约 62% 准确率)。有趣的是,与普遍观察相反,使用思维链提示并未观察到准确率的显著提升。为评估局限性,我们进行了错误分析,揭示概念性错误(约 64%)相较于计算性错误(约 36%)是导致 LLM 性能下降的主要原因。我们希望本工作的数据集与分析能推动开发更好的材料科学领域特定 LLM 及信息抽取策略的进一步研究。

关键词

引用

@article{arxiv.2308.09115,
  title  = {MaScQA: A Question Answering Dataset for Investigating Materials Science Knowledge of Large Language Models},
  author = {Mohd Zaki and Jayadeva and Mausam and N. M. Anoop Krishnan},
  journal= {arXiv preprint arXiv:2308.09115},
  year   = {2023}
}