S²ALM:面向全面抗体表征学习的序列-结构预训练大型语言模型
机器学习
2024-11-26 v1 人工智能
生物大分子
摘要
抗体通过其精准且强大的与特定抗原的结合,保护我们的健康,在治疗包括新冠病毒在内的多种疾病方面展现出巨大的治疗潜力。最近的生物医学语言模型研究表明,巨大的潜力来自于解释复杂的生物结构和功能。然而,现有的针对抗体的特定模型存在一个显著局限,就是缺乏对抗体结构信息的明确考虑,尽管序列和三维结构都携带独特且互补的关于抗体行为和功能的见解。本文提出了序列-结构多级预训练抗体语言模型(S²ALM),将整体序列和结构信息整合到一个统一的、通用的抗体基础模型中。我们构建了一个包含两个自定义多级训练目标的分层预训练范式,以促进对全面抗体表征的建模。S²ALM的表征空间揭示了内在的功能性结合机制、生物演化特性和结构相互作用模式。在7500万序列和1170万结构上预训练后,S²ALM可用于各种下游任务:准确预测抗原-抗体结合亲和力、精确区分B细胞成熟阶段、识别抗体关键结合位点以及特异性设计新型新冠结合抗体。显然,S²ALM在广泛的抗体特定理解和生成任务中超越了众所周知的基准,并取得了新的最佳性能。S²ALM对综合和通用表征的建模能力进一步定位了其在实际治疗抗体开发中的潜力,可能满足学术、工业和临床层面的需求。
引用
@article{arxiv.2411.15215,
title = {S$^2$ALM: Sequence-Structure Pre-trained Large Language Model for Comprehensive Antibody Representation Learning},
author = {Mingze Yin and Hanjing Zhou and Jialu Wu and Yiheng Zhu and Yuxuan Zhan and Zitai Kong and Hongxia Xu and Chang-Yu Hsieh and Jintai Chen and Tingjun Hou and Jian Wu},
journal= {arXiv preprint arXiv:2411.15215},
year = {2024}
}