LLM4Mat-Bench:面向材料属性预测的大型语言模型基准测试
材料科学
2024-12-03 v3 计算与语言
摘要
大型语言模型(LLMs)正越来越多地应用于材料科学。然而,对于基于LLM的材料属性预测的基准测试和标准化评估关注甚少,这阻碍了进展。我们提出了LLM4Mat-Bench,这是迄今为止用于评估LLMs在预测晶体材料属性方面性能的最大基准。LLM4Mat-Bench总共包含约190万个晶体结构,收集自10个公开可用的材料数据源,涉及45种不同的属性。LLM4Mat-Bench具有不同的输入模态:晶体组成、CIF和晶体文本描述,每种模态的总词元数分别为470万、6.155亿和31亿。我们使用LLM4Mat-Bench来微调不同规模的模型,包括LLM-Prop和MatBERT,并提供零样本和少样本提示来评估类似LLM-chat的模型(包括Llama、Gemma和Mistral)的属性预测能力。结果凸显了通用LLMs在材料科学中面临的挑战,以及在材料属性预测中对任务特定预测模型和任务特定指令微调LLMs的需求。
引用
@article{arxiv.2411.00177,
title = {LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction},
author = {Andre Niyongabo Rubungo and Kangming Li and Jason Hattrick-Simpers and Adji Bousso Dieng},
journal= {arXiv preprint arXiv:2411.00177},
year = {2024}
}
备注
Accepted at NeurIPS 2024-AI4Mat Workshop. The Benchmark and code can be found at https://github.com/vertaix/LLM4Mat-Bench