中文

基于可微图划分的蛋白质语言模型表示的结构解释

机器学习 2026-05-13 v1 人工智能 生物大分子

摘要

蛋白质语言模型如ESM-2学习到的残基表示在蛋白质功能预测中表现优异,但其特征难以解释,因为结构与演化信号编码在稠密的潜在空间中。我们提出了一个即插即用的框架,将ESM-2表示投影到蛋白质接触图上,并应用SoftBlobGIN——一种轻量级图同构网络,集成可微Gumbel-softmax子结构池化,用于结构感知消息传递并学习下游预测任务的粗糙功能亚结构。在酶分类任务中,SoftBlobGIN实现了92.8%的准确率和0.898的宏平均F1分数。与仅对蛋白质语言模型进行后置分析不同,我们的方法生成可直接审计的结构解释:GNNExplainer恢复生物学上有意义的活性位残基、空间局部化的功能簇以及催化接触模式。在结合位点检测任务中,SoftBlobGIN将残基AUROC从仅用ESM-2线性探针的0.885提升至0.983,表明这些结构解释无法仅从语言模型特征中恢复。学习的blob划分通过自动将残基分组为功能亚结构,提供了额外的可解释性层面,包含标注活性位残基的blob比其他blob重要性高1.85倍(ρ=0.339,p=0.009),且无需任何活性位监督。该框架无需重新训练语言模型,仅增加约1.1M参数,即可在ProteinShake任务上普适化,实现Gene Ontology预测上的F_max为0.733,结合位点检测的AUROC为0.969。我们将其定位为蛋白质语言模型的可解释结构伴随器,使其预测更加透明且可审计。

关键词

引用

@article{arxiv.2605.10985,
  title  = {Structural Interpretations of Protein Language Model Representations via Differentiable Graph Partitioning},
  author = {Siddhant Dutta and Edward Tan Beng Wai and Soumick Sarker and Pasan Gunawardane and Jagath C. Rajapakse},
  journal= {arXiv preprint arXiv:2605.10985},
  year   = {2026}
}

备注

19 Pages, 8 figures, 11 Tables, Submitted to NeurIPS 2026