辅助大语言模型的数据驱动因果发现
材料科学
2025-03-19 v1 机器学习
摘要
知识驱动的新材料发现要求发展用于描述性质产生机制的因果模型。虽然在经典物理范式下,因果关系基于物理原理或通过实验推导,但快速积累的观测数据使得基于观察数据学习结构与功能之间因果关系成为必要。为此,必须将实验数据与先验领域知识相结合。本文通过将高分辨率扫描电子显微镜 (STEM) 数据与来自大语言模型 (LLM) 的洞见相结合,演示了这一方法。通过对 ChatGPT 在铁电体领域文献(如 arXiv 论文)进行微调,并将获得的信息与数据驱动因果发现相结合,我们为 Sm 掺杂 BiFeO3 (SmBFO) 中结构、化学和极化自由度之间的因果关系构建邻接矩阵,对应于有向无环图 (DAG)。该方法使我们能够假设合成条件如何影响材料属性,特别是 coercive field (E0),并指导实验验证。本工作的最终目标是开发一个统一框架,将 LLM 驱动的文献分析与数据驱动发现相集成,以建立合成条件与其结果材料属性之间清晰联系,从而实现对铁电体材料的精确工程化。
引用
@article{arxiv.2503.13833,
title = {Causal Discovery from Data Assisted by Large Language Models},
author = {Kamyar Barakati and Alexander Molak and Chris Nelson and Xiaohang Zhang and Ichiro Takeuchi and Sergei V. Kalinin},
journal= {arXiv preprint arXiv:2503.13833},
year = {2025}
}
备注
12 pages, 5 figures