癌症遗传学知识库构建的半自动化方法
计算与语言
2020-05-27 v2 信息检索
摘要
在这项工作中,我们关注癌症遗传学中呈指数增长的子领域。为综合并集中这些证据以供传播,一组医生手动构建并维护着一个知识库,以提炼文献中报道的关键结果。这是一个繁琐的过程,需要通读全文文章以理解研究设计、评估研究质量,并提取与特定遗传性癌症基因(即外显率)相关的报道癌症风险估计。在这项工作中,我们提出模型以自动从全文癌症遗传学文章中提取关键要素,最终目标是加速当前在用的手动工作流。我们提出两个对刻画癌症遗传学研究报道发现至关重要的挑战性任务:(i)提取描述确定机制(ascertainment mechanisms)的文本片段,其进而可提示所研究人群是否可能因偏离目标人群而引入偏倚;(ii)提取与特定种系突变相关的报道风险估计(例如比值比或风险比)。后一任务可视为一个联合实体标注与关系抽取问题。为训练这些任务的模型,我们利用手动构建的知识库对全文文章中的词元与片段施加远程监督。我们提出并评估了若干模型变体,包括一个基于 transformer 的联合实体与关系抽取模型来抽取<种系突变,风险估计>对。我们观察到强劲的实证性能,凸显了此类模型在该领域辅助知识库构建的实际潜力。我们对模型组件进行消融,例如观察到<种系突变,风险估计>的联合模型明显优于流水线式方法。
引用
@article{arxiv.2005.08146,
title = {Semi-Automating Knowledge Base Construction for Cancer Genetics},
author = {Somin Wadhwa and Kanhua Yin and Kevin S. Hughes and Byron C. Wallace},
journal= {arXiv preprint arXiv:2005.08146},
year = {2020}
}
备注
In proceedings of the Conference on Automated Knowledge Base Construction (AKBC), 2020