中文

利用批量转录组测序优化监督机器学习样本量:一种学习曲线方法

统计方法学 2024-09-11 v1 基因组学

摘要

利用转录组学数据进行准确的样本分类对于推进个性化医疗至关重要。实现这一目标需要确定一个合适的样本量,以确保足够的统计功效,同时避免不必要的资源分配。当前的样本量计算方法依赖于可能与用于样本分类的监督机器学习技术不匹配的假设和算法。为了解决这一关键的方法论差距,我们提出了一种新颖的计算方法,该方法通过采用数据增强策略,然后拟合学习曲线,来建立统计功效与样本量之间的关系。我们基于一系列评估指标,综合考虑了不同的数据特征和算法配置,全面评估了该方法在 microRNA 和 RNA 测序数据上的性能。为了促进可访问性和可重复性,实现我们方法的 Python 和 R 代码已在 GitHub 上提供。其部署将显著促进机器学习在转录组学研究中的应用,并加速其转化为用于个性化治疗的临床有用分类器。

关键词

引用

@article{arxiv.2409.06180,
  title  = {Optimizing Sample Size for Supervised Machine Learning with Bulk Transcriptomic Sequencing: A Learning Curve Approach},
  author = {Yunhui Qi and Xinyi Wang and Li-Xuan Qin},
  journal= {arXiv preprint arXiv:2409.06180},
  year   = {2024}
}

备注

34 pages, 6 figures and extended data