ImDrug:面向 AI 辅助药物发现中深度不平衡学习的基准
机器学习
2022-10-20 v2 人工智能
定量方法
摘要
过去十年见证了 AI 辅助药物发现(AIDD)计算方法与数据集整理的蓬勃发展。然而,真实世界的药物数据集常呈现高度不平衡分布,这一点被当前文献所忽视,但可能严重损害机器学习应用的公平性与泛化能力。受此观察启发,我们引入 ImDrug,一个包含开源 Python 库的综合基准,由 4 种不平衡设置、11 个 AI 就绪数据集、54 个学习任务和 16 种面向不平衡学习的基线算法组成。它为涵盖药物发现流程广泛环节(如分子建模、药物-靶点相互作用和逆合成)的问题与方案提供了可及且可定制的测试平台。我们利用新颖的评估指标进行了广泛的实证研究,表明现有算法在数据不平衡场景下不足以解决医学与药物挑战。我们相信 ImDrug 为 AIDD 与深度不平衡学习交叉处的真实世界挑战的未来研究与开发开辟了道路。
引用
@article{arxiv.2209.07921,
title = {ImDrug: A Benchmark for Deep Imbalanced Learning in AI-aided Drug Discovery},
author = {Lanqing Li and Liang Zeng and Ziqi Gao and Shen Yuan and Yatao Bian and Bingzhe Wu and Hengtong Zhang and Yang Yu and Chan Lu and Zhipeng Zhou and Hongteng Xu and Jia Li and Peilin Zhao and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2209.07921},
year = {2022}
}
备注
29 pages, 7 figures, 8 tables, a machine learning benchmark submission