中文

DuaDeep-SeqAffinity:用于仅基于序列的抗原-抗体亲和力预测的双流深度学习框架

机器学习 2025-12-29 v1

摘要

预测抗原与抗体之间的结合亲和力是药物发现和疫苗开发的基础。传统的计算方法通常依赖于实验确定的三维结构,这些结构稀缺且计算成本高昂。本文介绍了 DuaDeep-SeqAffinity,一种新颖的仅基于序列的深度学习框架,它使用双流混合架构,仅从氨基酸序列预测亲和力得分。我们的方法利用预训练的 ESM-2 蛋白质语言模型嵌入,将用于局部基序检测的一维卷积神经网络 (CNN) 与用于全局上下文表示的 Transformer 编码器相结合。随后的融合模块整合这些多方面的特征,然后将其传递给全连接网络进行最终得分回归。实验结果表明,DuaDeep-SeqAffinity 显著优于单个架构组件和现有的最先进 (SOTA) 方法。DuaDeep 实现了 0.688 的优越皮尔逊相关系数、0.460 的 R2R^2 和 0.737 的均方根误差 (RMSE),超越了单分支变体 ESM-CNN 和 ESM-Transformer。值得注意的是,该模型实现了 0.890 的曲线下面积 (AUC),优于仅基于序列的基准,甚至超越了结构-序列混合模型。这些发现证明,高保真序列嵌入可以捕获通常为结构建模所保留的基本结合模式。通过消除对三维结构的依赖,DuaDeep-SeqAffinity 为大规模序列库的高通量筛选提供了一种高度可扩展且高效的解决方案,显著加速了治疗性药物的发现流程。

关键词

引用

@article{arxiv.2512.22007,
  title  = {DuaDeep-SeqAffinity: Dual-Stream Deep Learning Framework for Sequence-Only Antigen-Antibody Affinity Prediction},
  author = {Aicha Boutorh and Soumia Bouyahiaoui and Sara Belhadj and Nour El Yakine Guendouz and Manel Kara Laouar},
  journal= {arXiv preprint arXiv:2512.22007},
  year   = {2025}
}