中文

面向蛋白质序列的对抗对比预训练

计算与语言 2021-02-02 v1 人工智能

摘要

自然语言处理(Natural Language Processing, NLP)的最新进展表明,大规模自监督预训练对下游任务极为有益。这些思想已被适配到其他领域,包括蛋白质氨基酸序列的分析。然而,迄今为止大多数针对蛋白质序列的尝试依赖于直接的掩码语言模型风格预训练。在这项工作中,我们设计了一种新的、针对蛋白质的对抗式预训练方法,扩展并专门化了NLP中的类似进展。我们展示了相较于传统MLM预训练令人信服的结果,尽管需要进一步开发以确保所获得的收益值得巨大的计算成本。

关键词

引用

@article{arxiv.2102.00466,
  title  = {Adversarial Contrastive Pre-training for Protein Sequences},
  author = {Matthew B. A. McDermott and Brendan Yap and Harry Hsu and Di Jin and Peter Szolovits},
  journal= {arXiv preprint arXiv:2102.00466},
  year   = {2021}
}