当分子相似性有效时:属性悬崖揭示隐藏错误
机器学习
2026-05-19 v1
摘要
分子属性的准确预测是药物发现和材料设计的基石,但即使是最先进的模型也对无法被聚合指标检测的局部失效模式仍然脆弱。分子相似性应最有帮助的地方也是标准评估最可能误导的地方。属性悬崖暴露了这一差距:结构相似的分子仍可能在目标属性上发生尖锐差异,因此在整体性能方面具有竞争力的模型可能在高风险局部邻域中失败。为揭示和缓解此失效模式,本文引入CliffSplit(一种悬崖感知评估协议,构建局部支持、悬崖暴露的测试案例)和CliffLoss(一种针对悬崖敏感错误的模型无关训练-only缓解机制)。在三个QM9目标和三个MoleculeNet任务上使用五个不同骨干网络进行实验,显示CliffSplit在悬崖重型QM9区域揭示至少15%更高的误差,而CliffLoss在Lipophilicity上将悬崖到光滑误差间隔降低最高30%,并提高整体MAE 9.7%。这些结果将分子相似性失效从描述性异常转化为基准化评估问题,用于分子机器学习。代码地址为https://anonymous.4open.science/r/Cliff_Loss。
关键词
引用
@article{arxiv.2605.17265,
title = {When Molecular Similarity Works: Property Cliffs Reveal Hidden Errors},
author = {Di Hu and Kun Li and Haojie Rao and Longtao Hu and Jiameng Chen and Wenbin Hu and Yizhen Zheng and Jiajun Yu and Duanhua Cao},
journal= {arXiv preprint arXiv:2605.17265},
year = {2026}
}
备注
Preprint, 22 pages, 10 figures, 11 tables. Di Hu and Kun Li contributed equally