中文

基于序列的蛋白质表示用于帕金森病分类的局限性:一个无泄漏的基准测试

定量方法 2026-05-19 v2 人工智能 机器学习

摘要

由于帕金森病的多因素性质,识别可靠的分子生物标志物仍然具有挑战性。尽管蛋白质序列构成了一种基础且广泛可用的生物信息来源,但它们对复杂疾病分类的独立判别能力仍不清楚。在这项工作中,我们对完全源自蛋白质一级序列的多种表示进行了受控且无泄漏的评估,包括氨基酸组成、k-mer、物理化学描述符、混合表示以及来自蛋白质语言模型的嵌入,所有评估均在嵌套分层交叉验证框架下进行,以确保无偏的性能估计。表现最佳的配置(ProtBERT + MLP)达到了0.704 +/- 0.028的F1分数和0.748 +/- 0.047的ROC-AUC,表明仅有中等判别性能。诸如k-mer之类的经典表示达到了可比的F1值(高达约0.667),但表现出高度不平衡的行为,召回率接近0.98,精确率约为0.50,反映了对正预测的强烈偏向。在各种表示中,性能差异保持在一个狭窄的范围内(F1在0.60到0.70之间),而无监督分析揭示没有与类别标签对齐的内在结构,统计检验(Friedman检验,p = 0.1749)也未表明模型之间存在显著差异。这些结果表明类别之间存在大量重叠,并指出仅凭一级序列信息对帕金森病分类提供的判别能力有限。这项工作建立了一个可重复的基线,并提供了经验证据,表明需要更具信息性的生物特征,例如结构、功能或基于相互作用的描述符,才能进行稳健的疾病建模。

关键词

引用

@article{arxiv.2604.11852,
  title  = {Limitations of Sequence-Based Protein Representations for Parkinson's Disease Classification: A Leakage-Free Benchmark},
  author = {César Jesús Núñez-Prado and Grigori Sidorov and Liliana Chanona-Hernández},
  journal= {arXiv preprint arXiv:2604.11852},
  year   = {2026}
}

备注

36 pages, 10 figures, 9 tables. Updated title, abstract, figures, and revised experimental discussion