中文

从 Token 到材料:利用语言模型进行科学发现

计算与语言 2024-11-05 v2 数据库

摘要

探索语言模型在材料科学中的预测能力是持续进行的研究。本研究考察了将语言模型嵌入用于提升材料性质预测中能力的方法。通过评估各种上下文嵌入方法和预训练模型,包括双向编码器表示来自变换器(BERT)和生成式预训练变换器(GPT),我们证明了领域特定模型,特别是 MatBERT 在从化合物名称和材料性质中提取隐式知识方面显著优于通用模型。我们的发现表明,MatBERT 第三层的信息密集嵌入,结合上下文平均方法,能够最有效地捕获材料-性质关系。我们还识别出一种关键的“标记器效应”,强调了专门文本处理技术的重要性,这些技术在保持完整化合物名称的同时维持一致的标记计数。这些见解凸显了领域特定训练和标记化在材料科学应用中的价值,并为通过 AI 驱动方法加速新材料的发现和开发提供了前景路径。

关键词

引用

@article{arxiv.2410.16165,
  title  = {From Tokens to Materials: Leveraging Language Models for Scientific Discovery},
  author = {Yuwei Wan and Tong Xie and Nan Wu and Wenjie Zhang and Chunyu Kit and Bram Hoex},
  journal= {arXiv preprint arXiv:2410.16165},
  year   = {2024}
}