中文

BARTSmiles:面向分子表示的生成式掩码语言模型

机器学习 2022-11-30 v1 生物大分子

摘要

通过一系列量身定制的深入消融实验,我们发现了一种针对分子表示的生成式掩码语言模型的鲁棒自监督策略。使用这一预训练策略,我们训练了 BARTSmiles,这是一个类 BART 模型,其计算量比以往的自监督分子表示大一个数量级。深入评估表明,BARTSmiles 在分类、回归和生成任务中始终优于其他自监督表示,在 11 项任务上创下了新的 SOTA。随后我们定量地表明,当应用于分子领域时,BART 目标学习到的表示隐式地编码了我们感兴趣的下游任务。例如,通过从冻结的 BARTSmiles 中选取七个神经元,我们可以获得一个在 Clintox 任务上性能与完全微调模型相差不到两个百分点的模型。最后,我们表明,当应用于 BARTSmiles 时,标准的归因可解释性方法突出了化学家用来解释分子特定性质的某些子结构。代码和预训练模型已公开提供。

关键词

引用

@article{arxiv.2211.16349,
  title  = {BARTSmiles: Generative Masked Language Models for Molecular Representations},
  author = {Gayane Chilingaryan and Hovhannes Tamoyan and Ani Tevosyan and Nelly Babayan and Lusine Khondkaryan and Karen Hambardzumyan and Zaven Navoyan and Hrant Khachatrian and Armen Aghajanyan},
  journal= {arXiv preprint arXiv:2211.16349},
  year   = {2022}
}

备注

27 pages (including appendix)