中文

从文献提取治疗设计先验知识的数据集

机器学习 2025-09-15 v2

摘要

AI 驱动的发现可大幅减少设计时间并提升新型治疗方案的有效性。使用模拟器进行建模的方法虽能探索广阔的设计空间,但因缺乏实验先验知识,风险可能违反隐式约束。例如,我们对 GuacaMol 基准上多样化模型的分析显示,超过 60% 的分子被预测为可能具有致突变性。本文介绍 Medex,即从描述实验室中使用化合物的文献中提取的设计问题先验知识数据集。它采用 LLM 流程线发现治疗性实体,并将信息总结为简洁且合规使用的事实。Medex 包含 3230 万对自然语言事实,以及相应的实体表示(即 SMILES 或 refseq ID)。为演示该数据的潜力,我们训练了 LLM、CLIP 和 LLava 架构,以在文本和设计目标之间进行联合推理,并在治疗数据公共领域 (TDC) 的任务上进行评估。Medex 在为模型构建强先验方面效果显著:在使用我们的数据作为预训练的监督预测问题中,我们的最佳模型(参数量为 1500 万)在回归和分类 TDC 任务上超越了 20 亿参数的 TxGemma 模型,在平均水平上与 90 亿参数模型相当。使用 Medex 构建的模型可作为优化新型分子的约束,导致提议更安全且接近同样有效。我们在 https://huggingface.co/datasets/medexanon/Medex 上公开该数据集,并将在文献增长时提供扩展版本。

关键词

引用

@article{arxiv.2508.10899,
  title  = {A Dataset for Distilling Knowledge Priors from Literature for Therapeutic Design},
  author = {Haydn Thomas Jones and Natalie Maus and Josh Magnus Ludan and Maggie Ziyu Huan and Jiaming Liang and Marcelo Der Torossian Torres and Jiatao Liang and Zachary Ives and Yoseph Barash and Cesar de la Fuente-Nunez and Jacob R. Gardner and Mark Yatskar},
  journal= {arXiv preprint arXiv:2508.10899},
  year   = {2025}
}