CAP:基于交换代数的数质-核生物结合亲和力预测
定量方法
2025-10-28 v1
摘要
准确预测蛋白质-核生物结合亲和力是解密基因组学过程的关键,但现有方法往往难以在高精度、可解释性和计算效率之间取得平衡。本研究引入交换代数预测(CAP)方法,融合持久斯坦纳-赖斯纳理论与先进的序列嵌入,用于预测蛋白质-核生物结合亲和力。CAP通过Transformer学习得到的嵌入对蛋白质进行编码,保留了长程演化背景;而DNA和RNA则采用由持久面理想派生的k-嵌入表示,捕捉了细粒度的核苷几何特征。我们证明,CAP在SVSBI蛋白质-核生物基准测试中超越了该基准,且在进一步测试中,对新编集的蛋白质-RNA和蛋白质-核生物数据集仍保持良好性能。仅凭初始序列,CAP即可对任意蛋白质-核生物配对进行推断,所需的预处理工作最小化,因而可用于无需3D结构数据的基因组尺度分析,并为药物发现和蛋白质工程的快速虚拟筛选提供前景。
引用
@article{arxiv.2510.22130,
title = {CAP: Commutative Algebra Prediction of Protein-Nucleic Acid Binding Affinities},
author = {Mushal Zia and Faisal Suwayyid and Yuta Hozumi and JunJie Wee and Hongsong Feng and Guo-Wei Wei},
journal= {arXiv preprint arXiv:2510.22130},
year = {2025}
}