中文

大语言模型预测性质时,简单更有效

材料科学 2025-07-10 v3 机器学习

摘要

从坐标-类别数据(由向量与类别信息配对而成的集合)预测性质是计算科学的基本任务。在材料科学中,这一挑战体现在于从由原子位置(向量)和元素类型(类别信息)构成的晶体结构中预测形成能或弹性模量等性质。尽管大语言模型(LLMs)越来越多地被应用于此类任务,但研究者通过将结构数据编码为文本的方式,尚未找到实现可靠预测的最优策略。本文报告了大语言模型学习坐标信息能力的基本局限性。通过使用可调节坐标与类别贡献的合成数据集,并结合涵盖多种表示方法和模型规模的全面基准框架(MatText),我们发现大语言模型始终未能捕捉坐标信息,却在类别模式方面表现出色。这一几何盲区无论是模型规模(最高达700亿参数)、数据规模(最高达200万结构)还是文本表示策略,都得以维持。我们的发现表明,对于结构效应占主导的材料性质预测任务,专用的几何架构以显著的优势 consistently 超越大语言模型,基准测试中形成明确的“GNN-LM墙”。基于我们的分析,我们提供了针对科学机器学习中架构选择的具体指导,同时强调在解决科学预测问题时,理解模型归纳偏置的重要性。

关键词

引用

@article{arxiv.2406.17295,
  title  = {Less can be more for predicting properties with large language models},
  author = {Nawaf Alampara and Santiago Miret and Kevin Maik Jablonka},
  journal= {arXiv preprint arXiv:2406.17295},
  year   = {2025}
}