CLAMP:一种对比语言与分子预训练网络
计算与语言
2023-11-15 v1 信息检索
摘要
本文强调了材料生成思路的转向。我们提出一种语言到材料的生成架构,利用数百万未开发的数据点,而非材料到材料的方式。通过使用网络爬虫从开源研究论文中收集晶体-文本对,可利用卷积图神经网络编码器与语言编码器训练一个对比模型。这将允许无监督零样本分类,其可通过利用语言结构进行训练。在没有任何特定训练数据的情况下,实现了约 82% 的准确率,并在极小数据集上取得约 75% 的光催化剂预测准确率。这一新颖网络理想情况下可跨应用于任何可通过文本描述的反应,为思考 3D 化学框架生成开辟全新方法。在完整实验中,可能会引入扩散模型以充分利用潜空间。
引用
@article{arxiv.2311.07617,
title = {CLAMP: A Contrastive Language And Molecule Pre-training Network},
author = {Neel Redkar},
journal= {arXiv preprint arXiv:2311.07617},
year = {2023}
}
备注
3 pages, 1 figure, Presenting @ NeurIPS23 & Workshop - source @ https://github.com/neelr/clamp - dataset @ https://www.kaggle.com/datasets/programgeek01/cif-summary-data