中文

评估 LLM 在材料科学问答与性能预测中的表现与鲁棒性

计算与语言 2025-08-15 v2 材料科学 人工智能 机器学习

摘要

大型语言模型(LLMs)有潜力彻底改变科学研究,但其在特定领域应用中的鲁棒性和可靠性仍未被充分探索。在本研究中,我们评估了 LLMs 在材料科学中的表现和鲁棒性,重点关注特定领域的问答和材料性能预测,涵盖多种真实世界和对抗条件。本研究使用了三个不同的数据集:1)一组来自本科材料科学课程的多选题,2)包含各种钢成分和屈服强度的数据集,3)包含材料晶体结构文本描述和带隙值的带隙数据集。使用各种提示策略评估 LLMs 的性能,包括零样本思维链、专家提示和少样本上下文学习。通过测试这些模型对各种形式“噪声”的鲁棒性(从现实干扰到蓄意对抗操纵),评估它们在真实世界条件下的弹性和可靠性。此外,该研究展示了 LLMs 在预测任务中的独特现象,例如当提示示例的接近度改变时的模式崩溃行为,以及从训练/测试不匹配中的性能恢复。研究结果旨在为 LLMs 在材料科学中的广泛使用提供审慎的怀疑,并激发增强其在实际应用中鲁棒性和可靠性的进步。

关键词

引用

@article{arxiv.2409.14572,
  title  = {Evaluating the Performance and Robustness of LLMs in Materials Science Q&A and Property Predictions},
  author = {Hongchen Wang and Kangming Li and Scott Ramsay and Yao Fehlis and Edward Kim and Jason Hattrick-Simpers},
  journal= {arXiv preprint arXiv:2409.14572},
  year   = {2025}
}