Ankh3:结合序列去噪与补全的多任务预训练增强蛋白质表示
机器学习
2025-05-27 v1 定量方法
摘要
蛋白质语言模型(PLM)已成为检测蛋白质序列复杂模式的强大工具。然而,PLM 充分捕获蛋白质序列信息的能力可能因仅关注单一预训练任务而受限。尽管增加数据模态或监督目标可以提高 PLM 的性能,但预训练通常仍集中于对损坏序列进行去噪。为了突破 PLM 的极限,我们的研究调查了多任务预训练策略。我们开发了 Ankh3,这是一个在两个目标上联合优化的模型:具有多种掩码概率的掩码语言建模,以及仅依赖蛋白质序列作为输入的蛋白质序列补全。这种多任务预训练表明,PLM 可以仅从蛋白质序列中学习更丰富、更具泛化性的表示。结果表明,在二级结构预测、荧光、GB1 适应性和接触预测等下游任务中性能得到了提升。多任务的整合使模型对蛋白质特性有了更全面的理解,从而带来了更鲁棒和准确的预测。
引用
@article{arxiv.2505.20052,
title = {Ankh3: Multi-Task Pretraining with Sequence Denoising and Completion Enhances Protein Representations},
author = {Hazem Alsamkary and Mohamed Elshaffei and Mohamed Elkerdawy and Ahmed Elnaggar},
journal= {arXiv preprint arXiv:2505.20052},
year = {2025}
}
备注
8 pages, 0 figures