中文

MolXPT:用文本包裹分子进行生成式预训练

计算与语言 2023-05-29 v2

摘要

生成式预训练 Transformer(GPT)已在自然语言处理中展现巨大成功,相关技术也已适配于分子建模。考虑到文本是科学发现最重要的记录,本文提出 MolXPT,一种在由文本包裹的 SMILES(分子的序列表示)上预训练的文本与分子统一语言模型。简言之,我们检测每条序列中的分子名并替换为相应 SMILES。如此,SMILES 可利用周围文本的信息,反之亦然。上述包裹序列、来自 PubMed 的文本序列以及来自 PubChem 的 SMILES 序列均送入语言模型进行预训练。实验结果表明,MolXPT 在 MoleculeNet 上优于分子性质预测的强基线,在文本-分子翻译中与最优模型表现相当而参数量不到其一半,并支持无需微调的零样本分子生成。

关键词

引用

@article{arxiv.2305.10688,
  title  = {MolXPT: Wrapping Molecules with Text for Generative Pre-training},
  author = {Zequn Liu and Wei Zhang and Yingce Xia and Lijun Wu and Shufang Xie and Tao Qin and Ming Zhang and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2305.10688},
  year   = {2023}
}

备注

Accepted to ACL 2023; add more details about MoleculeNet finetune