中文

探索基于神经网络的知识蒸馏用于蛋白结合亲和力预测

机器学习 2026-01-08 v1 人工智能 生物大分子 分子网络 定量方法

摘要

预测蛋白质-蛋白质结合亲和力的精度与数据可得性之间的权衡,使得准确预测困难。缺乏经验证实的蛋白质结构限制了基于结构的机器学习模型性能,而这些模型通常优于基于序列的方法。为克服这一限制,我们提出一种基于知识蒸馏的回归框架,在训练期间使用蛋白质结构数据,在推理期间仅需序列数据。该方法利用结合亲和力标签和中间特征表示,在结构信息导师网络的指导下,联合监督训练基于序列的学生网络。采用留单复合交叉验证(LOCO)方法,对该框架在非冗余的蛋白质-蛋白质结合亲和力基准数据集上进行评估。序列-only 基线模型的最高皮尔逊相关系数(P_r)为 0.375,RMSE 为 2.712 kcal/mol;而基于结构的模型的 P_r 为 0.512,RMSE 为 2.445 kcal/mol。蒸馏式学生模型在 P_r 为 0.481、RMSE 为 2.488 kcal/mol 时,显著提升了基于序列的性能。通过详尽的误差分析,我们进一步确认了改进的一致性和降低的偏差。随着数据量的增加,这些发现表明知识蒸馏是一种高效的方法,可将结构知识传递给基于序列的预测器。 proposed distillation-based binding affinity predictor 的推理代码已公开于 https://github.com/wajidarshad/ProteinAffinityKD。

关键词

引用

@article{arxiv.2601.03704,
  title  = {Investigating Knowledge Distillation Through Neural Networks for Protein Binding Affinity Prediction},
  author = {Wajid Arshad Abbasi and Syed Ali Abbas and Maryum Bibi and Saiqa Andleeb and Muhammad Naveed Akhtar},
  journal= {arXiv preprint arXiv:2601.03704},
  year   = {2026}
}