面向精准医学的文献检索:基于神经匹配与分面摘要的方法
计算与语言
2020-12-18 v1 信息检索
摘要
精准医学(PM)的信息检索(IR)常涉及寻找刻画患者病例的多条证据。这通常至少包括适用于患者的疾病名称和基因变异。人口统计学属性、合并症和社会决定因素等其他因素也可能相关。因此,检索问题常被表述为临时搜索,但需纳入可能多个分面(如疾病、突变)。本文提出一种文档重排序方法,结合神经查询–文档匹配与文本摘要以应对此类检索场景。我们的架构基于基础BERT模型,并包含三个用于重排序的特定组件:(a) 文档–查询匹配,(b) 关键词抽取,(c) 分面条件化抽象摘要。组件(b)与(c)的结果用于实质上将候选文档转化为简洁摘要,从而可与手头查询比较以计算相关性得分。组件(a)直接为候选文档生成针对查询的匹配得分。整体架构受益于文档–查询匹配与基于PM分面摘要的文档转换新方法的互补潜力。使用NIST的TREC-PM track数据集(2017–2019)的评估表明,我们的模型达到了最先进性能。为促进可复现性,我们的代码已公开于:https://github.com/bionlproc/text-summ-for-doc-retrieval。
引用
@article{arxiv.2012.09355,
title = {Literature Retrieval for Precision Medicine with Neural Matching and Faceted Summarization},
author = {Jiho Noh and Ramakanth Kavuluru},
journal= {arXiv preprint arXiv:2012.09355},
year = {2020}
}
备注
Accepted to EMNLP 2020 Findings as Long Paper (11 page, 4 figures)