中文

PRESTO:渐进式预训练提升合成化学成果

机器学习 2024-06-21 v1 人工智能 计算与语言 化学物理

摘要

多模态大语言模型(MLLMs)在多个科学学科中的应用日益广泛。这些进展鼓励了在合成化学领域内对分子-文本建模的探索,该领域致力于设计和进行化学反应,以合成具有所需性质和用途的新化合物。然而,当前方法常常忽略多个分子图交互在理解化学反应中的关键作用,导致在合成化学任务中性能欠佳。本研究提出了PRESTO(渐进式预训练提升合成化学成果),这是一个通过整合预训练策略和数据集配置的综合基准来弥合分子-文本模态差距的新框架。它通过跨模态对齐和多图理解逐步改进多模态大语言模型。我们的广泛实验表明,PRESTO在下游合成化学任务中取得了有竞争力的结果。代码可在https://github.com/IDEA-XL/PRESTO获取。

关键词

引用

@article{arxiv.2406.13193,
  title  = {PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes},
  author = {He Cao and Yanjun Shao and Zhiyuan Liu and Zijing Liu and Xiangru Tang and Yuan Yao and Yu Li},
  journal= {arXiv preprint arXiv:2406.13193},
  year   = {2024}
}