LeMat-Synth:用于从科学文献中构建广泛合成程序数据库的多模态工具箱
数字图书馆
2025-11-03 v1 人工智能
信息检索
摘要
合成程序的开发仍是材料发现中的根本性挑战,程序知识散布在数十年的科学文献中,采用非结构化格式,难以进行系统分析。本文提出了一套多模态工具箱,采用大语言模型(LLM)和视觉语言模型(VLM)自动从材料科学出版物中提取并组织合成程序和性能数据,涵盖文本与图形。我们精选了81,000篇开放获取的论文,构建了LeMat-Synth(v1.0)数据集,包含涵盖35种合成方法和16种材料类别的合成程序,依据材料科学专属的本体结构进行组织。通过结合专家标注和可扩展的LLM评判框架,对提取质量在2,500个合成程序的子集上进行了严格评估。除数据集外,我们还发布了一套模块化、开源的软件库,旨在支持社区针对新语料库和合成领域进行扩展。总体而言,本工作为将非结构化文献转化为机器可读信息提供了可扩展的基础设施,为合成程序的预测建模以及合成-结构-性质关系的建模奠定了基础。
引用
@article{arxiv.2510.26824,
title = {LeMat-Synth: a multi-modal toolbox to curate broad synthesis procedure databases from scientific literature},
author = {Magdalena Lederbauer and Siddharth Betala and Xiyao Li and Ayush Jain and Amine Sehaba and Georgia Channing and Grégoire Germain and Anamaria Leonescu and Faris Flaifil and Alfonso Amayuelas and Alexandre Nozadze and Stefan P. Schmid and Mohd Zaki and Sudheesh Kumar Ethirajan and Elton Pan and Mathilde Franckel and Alexandre Duval and N. M. Anoop Krishnan and Samuel P. Gleason},
journal= {arXiv preprint arXiv:2510.26824},
year = {2025}
}
备注
29 pages, 13 figures, 6 tables