中文

BLIAM:基于文献的数据合成用于协同药物组合预测

计算与语言 2023-02-17 v2

摘要

在科学文献语料库上预训练的语言模型通过为下游应用提供高质量特征表示,已大幅推进科学发现。然而,这些特征往往不可解释,因而向领域专家揭示的洞见有限。我们提出 BLIAM,一种基于文献的数据合成方法,不直接从语言模型获取特征,而是直接生成可解释且对下游应用模型无关的训练数据点。BLIAM 的核心思想是利用已有训练数据构建提示,再用这些提示合成新数据点。BLIAM 迭代执行这两步,因为新数据点将定义信息更丰富的提示,而新提示又反过来合成更精确的数据点。值得注意的是,基于文献的数据增强可能引入数据泄漏,因为下游应用中测试数据点的标签可能已在语言模型语料库中被提及。为防止此类泄漏,我们引入 GDSC-combo,一个在生物医学语言模型训练后发表的大规模药物组合发现数据集。我们发现,在这一严格的数据划分设定下,BLIAM 大幅优于非增强方法与人工提示。BLIAM 可进一步用于合成在生物医学实验中甚至未被测量的新药与细胞系的数据点。除颇具前景的预测性能外,BLIAM 合成的数据点可解释且模型无关,能够为体外实验提供计算机内增强。

关键词

引用

@article{arxiv.2302.06860,
  title  = {BLIAM: Literature-based Data Synthesis for Synergistic Drug Combination Prediction},
  author = {Cai Yang and Addie Woicik and Hoifung Poon and Sheng Wang},
  journal= {arXiv preprint arXiv:2302.06860},
  year   = {2023}
}