MolXPT:用文本包裹分子进行生成式预训练
计算与语言
2023-05-29 v2
摘要
生成式预训练 Transformer(GPT)已在自然语言处理中展现巨大成功,相关技术也已适配于分子建模。考虑到文本是科学发现最重要的记录,本文提出 MolXPT,一种在由文本包裹的 SMILES(分子的序列表示)上预训练的文本与分子统一语言模型。简言之,我们检测每条序列中的分子名并替换为相应 SMILES。如此,SMILES 可利用周围文本的信息,反之亦然。上述包裹序列、来自 PubMed 的文本序列以及来自 PubChem 的 SMILES 序列均送入语言模型进行预训练。实验结果表明,MolXPT 在 MoleculeNet 上优于分子性质预测的强基线,在文本-分子翻译中与最优模型表现相当而参数量不到其一半,并支持无需微调的零样本分子生成。
引用
@article{arxiv.2305.10688,
title = {MolXPT: Wrapping Molecules with Text for Generative Pre-training},
author = {Zequn Liu and Wei Zhang and Yingce Xia and Lijun Wu and Shufang Xie and Tao Qin and Ming Zhang and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2305.10688},
year = {2023}
}
备注
Accepted to ACL 2023; add more details about MoleculeNet finetune