基于正-未标记学习识别新的饮食限制相关基因的候选基因
机器学习
2025-03-10 v2
摘要
饮食限制(Dietary Restriction, DR)是最流行的抗衰老干预措施之一;最近探索了机器学习(Machine Learning, ML)用于从衰老相关基因中识别潜在的 DR 相关基因,以最小化扩充我们对 DR 知识所需的高成本实验室实验。然而,现有机器学习方法会对没有已知 DR 关系的基因 naively 标记为负例,假设基因缺乏 DR 相关注释表明其不具备 DR 相关性,而非缺乏证据。这会限制非 DR 相关基因(即已知非 DR 相关基因)的可靠性,以及方法识别新型 DR 相关基因的能力。本工作引入一种基于两步正-未标记学习(Positive-Unlabelled, PU)范式的 novel 基因优先级方法:我们首先采用基于相似性的、受 KNN 启发的方法,从没有已知 DR 关联的基因中筛选出可靠的负例。然后,使用这些可靠负例和所有已知正例来训练一个有效区分 DR 相关和非 DR 相关基因的分类器,最终用于生成更可靠的潜在新型 DR 相关基因的排名。我们的方法在三个预测准确性指标上显著优于(p<0.05)现有的研究方法,最佳情况下计算成本降低最高可达 40%,我们还识别出 4 个有潜力的 DR 相关基因(PRKAB1、PRKAB2、IRS2、PRKAG1),这些基因均有来自现有文献的证据支持其潜在的 DR 相关作用。
引用
@article{arxiv.2406.09898,
title = {Positive-Unlabelled Learning for identifying new candidate Dietary Restriction-related genes among Ageing-related genes},
author = {Jorge Paz-Ruza and Alex A. Freitas and Amparo Alonso-Betanzos and Bertha Guijarro-Berdiñas},
journal= {arXiv preprint arXiv:2406.09898},
year = {2025}
}