检索以解释:面向可解释药物靶点识别的证据驱动预测
机器学习
2025-05-28 v4 计算与语言
摘要
语言模型通过综合海量研究语料库,在推动科学发现方面展现出巨大潜力。许多复杂的科学研究问题具有多个 plausible 答案,每个答案均有不同强度的证据支持。然而,现有语言模型缺乏基于支持证据定量且忠实地比较答案 plausibility 的能力。为解决这一问题,我们提出了 Retrieve to Explain (R2E),一种基于检索的模型,能够根据从文档语料库中检索到的证据,对研究问题的所有可能答案进行评分和排序。该架构仅根据支持证据来表示每个答案,同时将答案本身进行掩码处理。这使我们能够将 Shapley 值等特征归因方法扩展至推理阶段,将答案分数透明地归因于支持证据。该架构还允许在不重新训练的情况下纳入新证据,包括以自然语言模板化的非文本数据模态。我们将 R2E 应用于药物靶点识别这一极具挑战性的科学发现任务,该任务是一个人在回路(human-in-the-loop)过程,失败代价极高且可解释性至关重要。在预测药物靶点是否随后将在临床试验中被确证为有效时,R2E 不仅匹配了不可解释的基于文献的模型,还超越了整个制药行业广泛使用的基于遗传学的靶点识别方法。
引用
@article{arxiv.2402.04068,
title = {Retrieve to Explain: Evidence-driven Predictions for Explainable Drug Target Identification},
author = {Ravi Patel and Angus Brayne and Rogier Hintzen and Daniel Jaroslawicz and Georgiana Neculae and Dane Corneil},
journal= {arXiv preprint arXiv:2402.04068},
year = {2025}
}
备注
Accepted at ACL 2025 (The 63rd Annual Meeting of the Association for Computational Linguistics)