中文

用于抗癌药物响应建模的大规模AI就绪数据

定量方法 2026-08-11 v1 机器学习

摘要

药物响应预测(DRP)模型是药物基因组学中一个活跃的研究领域,在加速有效抗癌药物的识别方面具有越来越大的潜力。然而,其预测性能常常受到数据集规模有限以及癌症空间和化学空间覆盖不足的制约。此外,不一致的基准测试实践阻碍了模型间的可靠比较。标准化框架(如预测肿瘤学模型评估的创新方法与新数据(IMPROVE)项目)提供了统一的数据模式和评估协议以实现一致的基准测试,但提高模型泛化能力需要更大、更多样化的训练数据。在本工作中,我们通过大规模整合药物基因组学数据(主要来自PharmacoDB)以及额外的较小数据源,实质性地扩展了IMPROVE基准。扩展后的资源包含数百万条药物响应测量数据、更广泛的多组学覆盖,以及化学多样性的大幅提升,新增了超过50,000种化合物。为了评估新数据集相对于原始IMPROVE基准数据集的影响,我们使用这两个数据集训练了DRP模型,并使用公共测试集和多种评估策略(包括药物盲测、癌症盲测和不相交数据划分)评估其预测性能。虽然癌症盲测性能与原始基准相当,但在扩展数据集上训练的模型在药物盲测和不相交设置中表现出持续的改进,表明对先前未见化合物的泛化能力增强。这些结果将扩展后的数据集定位为社区资源,为开发旨在辅助发现新型抗癌药物的DRP模型提供了更丰富的基础。

关键词

引用

@article{arxiv.2608.11444,
  title  = {Large-scale AI-Ready Data for Anti-Cancer Drug Response Modeling},
  author = {Vincent Lavelle and Yitan Zhu and Kaitlyn Marlor and Thomas Brettin and Rick Stevens},
  journal= {arXiv preprint arXiv:2608.11444},
  year   = {2026}
}