癌细胞系药物响应预测的学习曲线
定量方法
2020-11-30 v1 机器学习
摘要
受细胞系药物敏感性数据规模的驱动,研究者一直致力于开发机器学习(ML)模型以预测药物响应,从而推进癌症治疗。随着药物敏感性研究持续产生数据,一个常见问题是所提出的预测器能否借助更多训练数据进一步提升泛化性能。我们利用经验学习曲线来评估并比较在四个药物筛选数据集上训练的两个神经网络(NNs)与两个梯度提升决策树(GBDT)模型的数据缩放特性。学习曲线被精确拟合为幂律模型,为评估这些预测器的数据缩放行为提供了框架。曲线表明,在全部数据集与训练规模上,没有单一模型在预测性能上占优,说明这些曲线的形状依赖于特定的模型—数据集配对。多输入 NN(mNN)将基因表达与分子药物描述符分别输入子网络,优于单输入 NN(sNN)——后者将细胞与药物特征拼接后输入输入层。相比之下,对于其中两个数据集,经过超参数调优的 GBDT 在较小训练规模范围内表现优于两个 NN,而 mNN 在较大训练规模范围内表现更好。此外,曲线轨迹表明增加样本量有望进一步改善两个 NN 的预测分数。这些观察证明了使用学习曲线评估预测器的益处,提供了关于整体数据缩放特征的更广阔视角。拟合的幂律曲线提供了一种前瞻性性能指标,并可作为协同设计工具,指导实验生物学家与计算科学家设计未来实验。
引用
@article{arxiv.2011.12466,
title = {Learning Curves for Drug Response Prediction in Cancer Cell Lines},
author = {Alexander Partin and Thomas Brettin and Yvonne A. Evrard and Yitan Zhu and Hyunseung Yoo and Fangfang Xia and Songhao Jiang and Austin Clyde and Maulik Shukla and Michael Fonstein and James H. Doroshow and Rick Stevens},
journal= {arXiv preprint arXiv:2011.12466},
year = {2020}
}
备注
14 pages, 7 figures