中文

λ-缩放注意力:一种用于蛋白质序列高效建模的新型快速注意力机制

机器学习 2022-08-29 v1 定量方法

摘要

基于注意力的深度网络已成功应用于自然语言处理领域的文本数据。然而,由于蛋白质“词”的语义较弱(不同于纯文本词),其在蛋白质序列上的应用带来了额外挑战。标准注意力技术面临的这些未被探索的挑战包括(i)注意力分数消失问题和(ii)注意力分布的高方差。为此,我们引入一种新颖的 λ-缩放注意力技术,用于蛋白质序列的快速高效建模,解决了上述两个问题。据此开发了 λ-缩放注意力网络,并在蛋白质子序列层面的蛋白质功能预测任务上进行了评估。在生物过程(BP)和分子功能(MF)数据集上的实验表明,所提 λ-缩放注意力技术相较基于标准注意力的对照方法 F1 值显著提升(BP +2.01%,MF +4.67%),也优于最先进的 ProtVecGen-Plus 方法(BP +2.61%,MF +4.20%)。此外,训练过程中还观察到快速收敛(在半数轮数内收敛)与高效学习(训练与验证损失差异极小)。

关键词

引用

@article{arxiv.2201.02912,
  title  = {{\lambda}-Scaled-Attention: A Novel Fast Attention Mechanism for Efficient Modeling of Protein Sequences},
  author = {Ashish Ranjan and Md Shah Fahad and Akshay Deepak},
  journal= {arXiv preprint arXiv:2201.02912},
  year   = {2022}
}