CAST:基于交叉注意力的结构与文本多模态融合用于材料性质预测
机器学习
2025-08-11 v2 材料科学
人工智能
摘要
最近的图神经网络 (GNN) 进展显著增强了对材料性质的预测,通过将晶体结构建模为图来实现。然而,GNN 往往难以捕获全局结构特征,如晶体系统,从而限制了其预测性能。为克服这一问题,我们提出 CAST,一种基于交叉注意力的多模态模型,将图表示与材料文本描述相结合,有效保留关键的结构和组分信息。不同于前述方法(如 CrysMMNet 和 MultiMat),后者依赖聚合的材料级别嵌入,CAST 利用交叉注意力机制结合细粒度的图节点级别和文本标记级别特征。此外,我们引入一种掩码节点预测预训练策略,以进一步增强节点和文本嵌入之间的对齐。我们的实验结果表明,CAST 在四个关键材料性质——形成能、带隙、体模量和剪切模量— 上超越了现有基线模型,平均相对 MAE 改进范围为 10.2% 至 35.7%。注意力图的分析确认了预训练在有效对齐多模态表征方面的重要性。该研究强调了多模态学习框架在开发更准确和更具全局感知的预测模型方面的潜力。
引用
@article{arxiv.2502.06836,
title = {CAST: Cross Attention based multimodal fusion of Structure and Text for materials property prediction},
author = {Jaewan Lee and Changyoung Park and Hongjun Yang and Sungbin Lim and Woohyung Lim and Sehui Han},
journal= {arXiv preprint arXiv:2502.06836},
year = {2025}
}
备注
11 pages, 4 figures