中文

大语言模型能否仅通过阅读合成与处理文档来预测聚合物物理学?

机器学习 2026-05-12 v1 材料科学 人工智能

摘要

大语言模型能否仅通过阅读非结构化的科学文献来预测聚合物的物理和机械属性?聚合物性能 rarely 由化学结构 alone 决定;相同的名义聚合物根据其合成路线、加工历史、形貌和测试条件,可能呈现出截然不同的行为。然而,当前最先进的聚合物属性模型通常依赖结构-only 表示——如 SMILES 或分子图——这些表示会剥离此关键实验背景。本文引入了 **PolyLM**,一个仅使用自然语言、具备过程和条件感知能力的框架,直接从完整文献预测材料性能。通过完全规避结构输入,PolyLM 保留了领域科学家报告的合成和加工的细微、非结构化描述。为训练此框架,我们构建了规模空前的数据集,涵盖 185,000 篇科学论文和 276,400 个独特聚合物样本,涉及 22 项物理、机械和热力学性质。我们采用低秩适配 (LoRA) 和任务级不确定性加权,对 90 亿参数的大语言模型 (Qwen3.5-9B) 进行微调。在 68,283 条保留观测数据上,该模型实现了惊人的高预测准确率,树立了复杂性质的新型状况基准。在 22 项多样化目标上,模型中位数 R2R^2 为 0.74,关键热力学、机械和物化性质的预测经常超过 R2R^2 为 0.80。这些结果无疑表明,自然语言是一种强大且高度可扩展的接口,能够实现真实世界的材料性能预测。

关键词

引用

@article{arxiv.2605.08255,
  title  = {Can LLMs Predict Polymer Physics Just by Reading Synthesis and Processing Prose?},
  author = {Yuchu Liu and Rui Zhu and Jingwei Xiong and Haixu Tang},
  journal= {arXiv preprint arXiv:2605.08255},
  year   = {2026}
}