中文

Trial2Vec:基于自监督的零样本临床试验文档相似度检索

计算与语言 2022-10-11 v2 人工智能 机器学习

摘要

临床试验对药物开发至关重要,但开展起来极为昂贵且耗时。在设计临床试验时,研究相似的历史试验是有益的。然而,冗长的试验文档与标注数据的缺乏使得试验相似度检索十分困难。我们提出了一种零样本临床试验检索方法Trial2Vec,其通过自监督学习,无需标注相似的临床试验。具体而言,试验文档的元结构(如标题、合格标准、目标疾病)连同临床知识(如UMLS知识库 https://www.nlm.nih.gov/research/umls/index.html)被利用来自动生成对比样本。此外,Trial2Vec在编码试验文档时考虑元结构,从而生成紧凑的嵌入,聚合来自整个文档的多方面信息。我们通过可视化表明,我们的方法产生了医学可解释的嵌入,并且在我们的1600对标注试验对上评估的检索精确率/召回率方面,比最佳基线平均提升15%。此外,我们证明了预训练嵌入在超过24万试验的下游试验结局预测任务中带来益处。软件可在 https://github.com/RyanWangZf/Trial2Vec 获取。

关键词

引用

@article{arxiv.2206.14719,
  title  = {Trial2Vec: Zero-Shot Clinical Trial Document Similarity Search using Self-Supervision},
  author = {Zifeng Wang and Jimeng Sun},
  journal= {arXiv preprint arXiv:2206.14719},
  year   = {2022}
}

备注

Findings of EMNLP 2022