文本到带隙:预训练语言模型作为半导体带隙预测的编码器
计算与语言
2025-10-24 v3 材料科学
摘要
本文研究了基于 Transformer 的语言模型(包括 RoBERTa、T5、Llama-3 与 MatSciBERT),用于直接从文本描述预测半导体材料的带隙。输入编码了关键的材料特征,如化学组成、晶系、空间群以及其他结构与电子性质。与需要大量特征工程的浅层机器学习模型,或依赖于由原子坐标导出的图表示的图神经网络不同,预训练语言模型可直接处理文本输入,无需人工特征预处理或基于结构的编码。材料描述以两种格式构建:采用一致模板的结构化字符串,以及通过 ChatGPT API 生成的自然语言叙述。每个模型均附加一个定制的回归头,并针对带隙预测任务进行微调。不同架构与参数规模的语言模型均能以高精度从人类可读文本预测带隙,MAE 达到 – eV 范围,凸显了该方法在科学回归任务中的成功。微调后的 Llama-3(参数量为 亿)取得了最高精度(MAE eV, )。在材料科学文献上预训练的 MatSciBERT 以显著更少的参数( 亿)达到了相当的性能(MAE eV, ),凸显了领域专用预训练的重要性。注意力分析表明,两个模型均选择性地聚焦于成分与自旋相关特征,而弱化几何特征,反映出从文本中捕捉空间信息的困难。这些结果证明,预训练语言模型能够有效地从文本形式的材料描述中提取复杂的特征-性质关系。
引用
@article{arxiv.2501.03456,
title = {Text to Band Gap: Pre-trained Language Models as Encoders for Semiconductor Band Gap Prediction},
author = {Ying-Ting Yeh and Janghoon Ock and Achuth Chandrasekhar and Shagun Maheshwari and Amir Barati Farimani},
journal= {arXiv preprint arXiv:2501.03456},
year = {2025}
}