中文

基于LLM的AI代理自动提取材料性质

机器学习 2026-03-10 v1 材料科学 人工智能 计算与语言

摘要

材料的快速发现受到缺乏大规模、可机器读取的数据集的制约,这些数据集需将性能指标与结构上下文相耦合。现有数据库要么规模较小、人工整理,要么偏向第一性原理结果,导致实验文献未被充分利用。我们提出了一种基于大语言模型(LLM)的智能体驱动工作流程,可自主地从约10,000篇全文科学论文中提取热电与结构性质。该流水线整合动态令牌分配、零样本多智能体提取和条件表格解析,以在准确性与计算成本之间取得平衡。在50篇精选论文上的基准测试表明,GPT-4.1取得了最高准确率(热电性质F1=0.91,结构字段F1=0.82),而GPT-4.1 Mini以极低的成本实现了接近可比的性能(F1分别为0.89和0.81),使得大规模实际部署成为可能。应用该工作流程,我们整理了27,822条温度分辨的性质记录,并统一了单位,涵盖优值(ZT)、塞贝克系数、电导率、电阻率、功率因子和热导率,以及晶体类别、空间群和掺杂策略等结构属性。数据集分析重现了已知的热电趋势,如合金优于氧化物和p型掺杂的优势,同时也揭示了更广泛的结构-性质关联。为方便社区访问,我们发布了一个具有语义筛选、数值查询和CSV导出功能的交互式网络探索器。本研究提供了迄今为止最大规模的LLM整理热电数据集,提供了一个可复现且已评估计算成本的提取流水线,并为超越热电领域的可扩展、数据驱动的材料发现奠定了基础。

关键词

引用

@article{arxiv.2510.01235,
  title  = {Automated Extraction of Material Properties using LLM-based AI Agents},
  author = {Subham Ghosh and Abhishek Tewari},
  journal= {arXiv preprint arXiv:2510.01235},
  year   = {2026}
}