你只训练一次:基于可微分子选取的Omics数据方法
机器学习
2025-12-22 v1 人工智能
摘要
从单细胞转录组数据中选择紧凑且信息丰富的基因子集对于生物标志物的发现、提高可解释性以及经济高效的表达分析至关重要。然而,大多数现有特征选择方法要么作为多阶段管道运行,要么依赖事后特征归因,导致选择与预测之间的耦合程度较弱。本文提出YOTO(you only train once)框架,实现端到端的联合离散基因子集识别与预测。该模型中,预测任务直接引导所选基因的选择,而所学习的子集又塑造预测表征,形成闭环反馈,使模型在训练期间能够迭代细化所选内容与预测方式。与现有方法不同,YOTO强制稀疏化,仅使所选基因参与推断,无需训练额外的下游分类器。通过多任务学习设计,模型在相关目标之间学习共享表征,使部分标记数据集能够相互影响,并发现跨任务的通用基因子集,而无需额外训练步骤。我们在两个代表性单细胞RNA-seq数据集上评估YOTO,结果表明其在多个指标上均显著优于最先进的基准方法。这些结果表明,稀疏、端到端、多任务的基因子集选择既提升了预测性能,又产生紧凑且有意义的基因子集,推动了生物标志物发现和单细胞分析的发展。
引用
@article{arxiv.2512.17678,
title = {You Only Train Once: Differentiable Subset Selection for Omics Data},
author = {Daphné Chopard and Jorge da Silva Gonçalves and Irene Cannistraci and Thomas M. Sutter and Julia E. Vogt},
journal= {arXiv preprint arXiv:2512.17678},
year = {2025}
}