中文

基于线性可扩展长上下文 Transformer 的蛋白质掩码语言建模

机器学习 2020-10-02 v3 计算与语言 机器学习

摘要

Transformer 模型已在众多领域中取得最先进的结果。然而,关于训练注意力机制以学习远距离输入间复杂依赖关系所需成本的担忧与日俱增。作为应对,利用所学注意力矩阵的结构与稀疏性的方案大量涌现。然而,涉及长序列的实际应用(如生物序列分析)可能难以满足这些假设,从而阻碍了对此类模型的探索。为应对这一挑战,我们提出一种基于正交随机特征快速注意力(FAVOR)的新 Transformer 架构 Performer。我们的机制在序列 token 数量上呈线性而非二次方扩展,具有次二次方的空间复杂度,且不引入任何稀疏模式先验。此外,它提供强有力的理论保证:注意力矩阵的无偏估计与一致收敛。它还与预训练的标准 Transformer 向后兼容。我们在具有挑战性的蛋白质序列建模任务上展示了其有效性,并提供了详尽的理论分析。

关键词

引用

@article{arxiv.2006.03555,
  title  = {Masked Language Modeling for Proteins via Linearly Scalable Long-Context Transformers},
  author = {Krzysztof Choromanski and Valerii Likhosherstov and David Dohan and Xingyou Song and Andreea Gane and Tamas Sarlos and Peter Hawkins and Jared Davis and David Belanger and Lucy Colwell and Adrian Weller},
  journal= {arXiv preprint arXiv:2006.03555},
  year   = {2020}
}

备注

This arXiv submission has been deprecated. Please see "Rethinking Attention with Performers" at arXiv:2009.14794 for the most updated version of the paper