中文

整合蛋白质序列与表达水平以分析乳腺癌亚型的分子表型

生物大分子 2025-10-31 v3 机器学习

摘要

乳腺癌的复杂性和可变性在理解其发展和指导有效治疗方面提出了重大挑战。本研究旨在整合蛋白质序列数据与表达水平,以改进乳腺癌亚型的分子表征并预测临床结局。使用专为蛋白质序列设计的语言模型 ProtGPT2,我们生成捕获蛋白质功能和结构属性的嵌入向量。将这些嵌入向量与蛋白质表达水平整合,形成丰富的生物学表征,并使用机器学习方法进行分析,如聚类中的集成 K 均值和分类中的 XGBoost。我们的ethods 成功地将患者聚类到生物学上具有不同特征的组中,并准确预测了诸如生存率和生物标志物状态等临床结局,取得了高性能指标,尤其是生存预测的 F1 分数为 0.88,生物标志物状态预测的 F1 分数为 0.87。特征重要性分析确定了 KMT2C、CLASP2 和 MYO1B 作为激素信号、细胞骨架重塑和治疗抗性在雌激素受体阳性和三阴性乳腺癌中关键蛋白质。这些蛋白质可能影响乳腺癌亚型的行为和发展。此外,蛋白质-蛋白质相互作用网络和相关分析揭示了可能影响乳腺癌亚型行为和发展的蛋白质之间的功能相互依赖关系。这些发现表明,整合蛋白质序列和表达数据提供了对肿瘤生物学的有价值见解,并在乳腺癌护理中提高个体化治疗策略具有重大潜力。

关键词

引用

@article{arxiv.2410.01755,
  title  = {Integrating Protein Sequence and Expression Level to Analysis Molecular Characterization of Breast Cancer Subtypes},
  author = {Hossein Sholehrasa and Majid Jaberi-Douraki},
  journal= {arXiv preprint arXiv:2410.01755},
  year   = {2025}
}