临床试验结果的自动化制表:一种基于 Transformer 语言表示的联合实体与关系抽取方法
计算与语言
2021-12-13 v1 人工智能
摘要
循证医学是医疗从业者在决策时参考最佳可用证据的实践,构成了现代医疗的基础。然而,它依赖于劳动密集型的系统综述,领域专家必须将数千篇出版物(主要为随机对照试验 (RCT) 结果)中的信息聚合提取至证据表中。本文通过将问题分解为两个语言处理任务来研究证据表生成的自动化:\textit{命名实体识别},识别文本中的关键实体(如药物名称);以及\textit{关系抽取},映射其关系以分离为有序元组。我们聚焦于从已发表 RCT 摘要中自动制表报告研究结果结局的句子。作为联合抽取流程的一部分,开发了两种深度神经网络模型,采用迁移学习与基于 transformer 的语言表示原理。为训练与测试这些模型,构建了一个新的黄金标准语料库,包含来自六个疾病领域的近 600 个结果句。该方法展现出显著优势,我们的系统在多个自然语言处理任务与疾病领域均表现良好,并能泛化至训练期间未见的疾病域。此外,我们表明这些结果可通过仅以少至 200 个示例句训练模型而实现。最终系统是一个概念验证,表明证据表的生成可半自动化,代表着朝完全自动化系统综述迈进的一步。
引用
@article{arxiv.2112.05596,
title = {Automated tabulation of clinical trial results: A joint entity and relation extraction approach with transformer-based language representations},
author = {Jetsun Whitton and Anthony Hunter},
journal= {arXiv preprint arXiv:2112.05596},
year = {2021}
}