训练分布决定了药物盲癌症灵敏度预测的上限
机器学习
2026-05-21 v1 定量方法
摘要
精准肿瘤学需要预测特定肿瘤从其分子轮廓中会抑制哪些药物,但尽管药物表征日益复杂,药物盲灵敏度预测仍停滞于瓶颈。我们在此表明,这种停滞反映的是一种指标伪影,而非表征瓶颈。标准基准测试 global Pearson r 主要受药物间效力差异支配,这种差异可被一个平凡的药物均值预测器捕获,而无需进行任何细胞特定的学习。改进的 per-drug Pearson r 隔离了药物内部细胞排序,揭示了在四个独立数据集上,没有任何药物编码能超过仅使用细胞特征的表现。我们进行了一个控制实验,将机制作用身份作为药物特征或训练分布约束来识别其原因。将 MoA 作为特征提供几乎没有额外好处,而将其用于分层训练可显著提高针对靶向酪氨酸激酶抑制剂的 per-drug r,因为 pan-cancer 共训练抑制了通路特定灵敏度信号。机制分层训练和来自 pilot 观察的响应匹配提供了两种可部署的策略,能够恢复药物盲灵敏度预测中主要预测增益的来源。
引用
@article{arxiv.2605.20885,
title = {Training distribution determines the ceiling of drug-blind cancer sensitivity prediction},
author = {Taekyung Heo},
journal= {arXiv preprint arXiv:2605.20885},
year = {2026}
}