非小细胞肺癌细胞系中辐射反应预测的整合转录组-蛋白组生物标志物识别
机器学习
2025-12-01 v1
摘要
为了开发一个用于识别预测非小细胞肺癌 (NSCLC) 细胞系中辐射反应生物标志物的框架(以 2 Gy 的存活率 (SF2) 衡量),我们收集了来自 73 个和 46 个 NSCLC 细胞系的 RNA 测序 (RNA-seq) 和数据独立获取质谱 (DIA-MS) 蛋白组数据。经过预处理后,保留下 1,605 个共享基因用于分析。使用最小绝对收缩和选择算子 (Lasso) 回归进行特征选择,其基于五折交叉验证重复十次的频率排序准则。构建了基于转录组、蛋白组和组合转录组-蛋白组特征集的支持向量回归 (SVR) 模型。通过系数决定系数 (R2) 和均方根误差 (RMSE) 评估模型性能。相关性分析评估了 RNA 和蛋白表达之间的一致性以及所选生物标志物与 SF2 的关系。RNA-蛋白表达显示出显著的正相关(中位 Pearson's r = 0.363)。独立管道从转录组、蛋白组和组合数据集中识别出 20 个优先生物标志物信号。单组学特征训练的模型在跨组学一般化方面有限,而组合模型在两个数据集中表现出平衡的预测准确性(转录组 R2=0.461, RMSE=0.120;蛋白组 R2=0.604, RMSE=0.111)。该研究首次提出了 NSCLC 中 SF2 预测的蛋白转录组框架,突显了整合转录组和蛋白组数据所具有的互补价值。所识别的concurrent 生物标志物捕捉了转录调控和功能蛋白活性,为机制理解和翻译潜力提供了见解。
引用
@article{arxiv.2511.22735,
title = {Integrated Transcriptomic-proteomic Biomarker Identification for Radiation Response Prediction in Non-small Cell Lung Cancer Cell Lines},
author = {Yajun Yu and Guoping Xu and Steve Jiang and Robert Timmerman and John Minna and Yuanyuan Zhang and Hao Peng},
journal= {arXiv preprint arXiv:2511.22735},
year = {2025}
}