ProtoCol:用于蛋白质同源搜索的晚期交互检索
机器学习
2026-05-29 v1 信息检索
生物大分子
摘要
蛋白质同源搜索是功能注释、结构预测和演化分析的基础,但在序列相似性较弱的“暮光区”中仍具有挑战性,此时经典比对方法灵敏度下降。蛋白质语言模型提供的上下文感知表示可提高此情境下的比对灵敏度。然而,先前的蛋白质嵌入检索管道常将这些表示聚合为单个向量,可能掩盖揭示远程同源的局部 motifs、domain 或保守残基。我们引入 ProtoCol,该模型将蛋白质表示为残基嵌入的集合,并采用 ColBERT 风格的晚期交互机制,以测试残基水平比较是否改善同源检索。ProtoCol 对蛋白质进行独立编码,保持候选表示可预计算,并通过对残基嵌入进行 MaxSim 评分。我们在 SCOPe 超级族和 Pfam 族基准上显示,ProtoCol 在序列组成、比对基于、池化 PLM 和训练单向量基线之外,超越了这些方法,支持晚期交互作为远程同源搜索有效检索层。
引用
@article{arxiv.2605.29158,
title = {PROTOCOL: Late Interaction Retrieval for Protein Homolog Search},
author = {Gabrielle Cohn and Rohan Gumaste and Minh Hoang and Vihan Lakshman},
journal= {arXiv preprint arXiv:2605.29158},
year = {2026}
}