中文

重编程语言模型用于分子表示学习

机器学习 2021-01-07 v2 分子网络

摘要

迁移学习的最新进展使其成为通过迁移已学表示进行领域自适应的一种有前景的方法。当相关任务仅有有限的定义明确且带标签的数据样本时(这在分子数据领域很常见),这一点尤为重要。这使得迁移学习成为解决分子学习任务的理想方法。尽管对抗重编程已被证明是重 purpose 神经网络用于其他任务的成功方法,多数工作考虑的是同一领域内的源任务与目标任务。本文中,受利用大规模最先进语言模型中已学表示的启发,我们提出一种新算法——基于字典学习的表示重编程(R2DL),用于对抗重编程预训练语言模型以完成分子学习任务。该对抗程序使用 k-SVD 求解器通过学习字典来近似编码数据的稀疏表示,从而学习稠密源模型输入空间(语言数据)与稀疏目标模型输入空间(例如化学与生物分子数据)之间的线性变换。R2DL 达到了基于领域特定数据训练的最先进毒性预测模型所建立的基线,并在有限训练数据设置下优于该基线,从而为具有分子数据的任务开辟了领域无关迁移学习的途径。

关键词

引用

@article{arxiv.2012.03460,
  title  = {Reprogramming Language Models for Molecular Representation Learning},
  author = {Ria Vinod and Pin-Yu Chen and Payel Das},
  journal= {arXiv preprint arXiv:2012.03460},
  year   = {2021}
}

备注

6 pages, 5 tables, accepted at Learning Meaningful Representations of Life @ NeurIPS 2020, Women in Machine Learning @ NeurIPS 2020. 8 pages, LaTeX; typos corrected, references added