中文

药物反应预测模型的社区基准测试:数据集、模型、工具与跨数据集泛化分析的评估指标

机器学习 2025-03-19 v1 定量方法

摘要

深度学习(DL)和机器学习(ML)模型在药物反应预测(DRP)中展现出潜力,但其在数据集之间的泛化能力仍是一个悬而未决的问题,引发对其实际应用可行性的担忧。由于缺乏标准化的基准测试方法,模型评估与比较往往依赖不一致的数据集和评估准则,使得评估真实预测能力变得困难。在本工作中,我们提出了一种用于评估DRP模型跨数据集预测泛化能力的基准测试框架。该框架整合了五个公开可用的药物筛选数据集、六种标准化的DRP模型以及一个可扩展的系统性评估工作流。为评估模型泛化能力,我们引入了一组评估指标,用于量化绝对性能(如跨数据集的预测精度)和相对性能(如与数据集内结果相比的性能下降),从而实现对模型可迁移性的更全面评估。我们的结果表明,当模型在未见数据集上进行测试时,性能出现显著下降,凸显了严格泛化评估的重要性。尽管若干模型展现出相对较强的跨数据集泛化能力,但没有单一模型在所有数据集上始终表现最优。此外,我们识别出CTRPv2是最有效的训练源数据集,在目标数据集上产生了更高的泛化分数。通过与社区共享这一标准化评估框架,本研究旨在为模型比较建立严谨的基础,并加速开发适用于实际应用的鲁棒DRP模型。

关键词

引用

@article{arxiv.2503.14356,
  title  = {Benchmarking community drug response prediction models: datasets, models, tools, and metrics for cross-dataset generalization analysis},
  author = {Alexander Partin and Priyanka Vasanthakumari and Oleksandr Narykov and Andreas Wilke and Natasha Koussa and Sara E. Jones and Yitan Zhu and Jamie C. Overbeek and Rajeev Jain and Gayara Demini Fernando and Cesar Sanchez-Villalobos and Cristina Garcia-Cardona and Jamaludin Mohd-Yusof and Nicholas Chia and Justin M. Wozniak and Souparno Ghosh and Ranadip Pal and Thomas S. Brettin and M. Ryan Weil and Rick L. Stevens},
  journal= {arXiv preprint arXiv:2503.14356},
  year   = {2025}
}

备注

18 pages, 9 figures