检索与竞争:蛋白质基础模型如何开始一个蛋白质
生物大分子
2026-05-19 v1 人工智能
摘要
蛋白质语言模型日益用于指导实验和临床决策,但往往难以判断是 confident prediction 源于对生物证据的识别,还是来自检索统计默认值。我们检视了 ESM2-8M 产生该近乎普遍生物学规则——蛋白质以甲硫氨酸开头——的计算路径。该模型并未在被遮盖位置检测到甲硫氨酸。相反,它通过来自参考表示中起始词汇表(beginning-of-sequence token)的甲硫氨酸偏好信号检索,借助跨层构建的、位置特异的查询实现,最终输出通过与情境依赖电路的竞争而产生。为了理解位置信息如何到达读出,我们引入了注意力得分在旋转频率带内的范数-方向分解。位置编码通过这些频带中查询范数和角度对齐的耦合变化实现。对于真实 N 端部不是甲硫氨酸的序列——生物学问题在此尤为重要——模型仍预测甲硫氨酸。这既不是通过意外机制产生的正确预测,而是匹配统计平均值、在生物学偏离其统计平均值的地方失败的定位-先验检索电路的输出。区分这两者需要在单个电路、频率带和查询组成水平上进行解析,表明对其中等生物学风险的预测进行机制性验证将是必要的且具有挑战性。即便针对最简单的生物学规则,该模型的预测也由分布式计算电路而非直接识别所主导,表明随任务复杂度增加,模型置信度与底层生物证据之间关系将进一步被模糊化。
引用
@article{arxiv.2605.16331,
title = {Retrieval and competition: how a protein foundation model starts a protein},
author = {Piotr Jedryszek and Oliver M. Crook},
journal= {arXiv preprint arXiv:2605.16331},
year = {2026}
}