COLOR:一种基于组合线性运算的蛋白质序列表示方法用于鉴定单体对性质的贡献
生物大分子
2025-01-14 v1
摘要
蛋白质和核酸等生物材料的性质主要由其一级序列决定。虽然序列中的某些片段强烈影响特定功能,但由于序列数据的复杂性,识别这些片段(即所谓的基序)具有挑战性。虽然深度学习模型能够准确捕捉序列-性质关系,但这些模型中的非线性程度限制了评估单体对性质的贡献——这是识别关键基序的关键步骤。可解释人工智能的最新进展提供了基于注意力和梯度的方法来估计单体贡献。然而,这些方法主要应用于分类任务,如结合位点识别,其准确率有限(40-45%),且依赖于定性评估。为了解决这些局限性,我们引入了一个具有可解释步骤的深度学习模型,能够直接追踪单体贡献。我们还提出了一种度量(),受图像分析和自然语言处理领域掩码技术的启发,用于对主要包含抗癌肽、抗菌肽和胶原蛋白不同性质的数据集进行定量分析。我们的模型可解释性提高了22%,精确定位了显著去稳定化抗癌肽的关键基序(RRR、RRI和RSS),并识别出抗菌肽中在将非抗菌肽转化为抗菌肽方面效率提高50%的基序。这些发现凸显了我们的模型在指导设计蛋白质基生物材料的突变策略方面的潜力。
引用
@article{arxiv.2501.06371,
title = {COLOR: A compositional linear operation-based representation of protein sequences for identification of monomer contributions to properties},
author = {Akash Pandey and Wei Chen and Sinan Keten},
journal= {arXiv preprint arXiv:2501.06371},
year = {2025}
}