开发并使用专用词典从临床笔记中进行队列选择
计算与语言
2019-02-27 v1
摘要
背景与意义:为临床试验选择队列通常需要昂贵且耗时的手工病历审查,导致参与度低。为助力自动化该过程,国家NLP临床挑战赛(N2C2)通过定义13条临床试验队列选择标准并提供训练与测试数据集举办了共享挑战。本研究受N2C2挑战推动。方法:我们将任务拆解为对应各标准的13个独立子任务,并使用规则或监督式机器学习模型实现子任务。每个任务关键依赖于以任务专用词典形式存在的知识资源,为此我们开发了一种新颖的模型驱动方法。该方法使我们能从种子集扩展词典并随后去除列表中的噪声,从而提高准确率。结果:我们的系统在挑战赛中获得总体F值0.9003,在45个参与者中统计并列第一。模型驱动词典开发及在训练集上进一步调试规则/代码将总体F值提升至0.9140,超过挑战赛最佳数值结果。讨论:队列选择如同表型提取与分类,适用于基于规则或简单机器学习方法,但所涉及的词典(如药物名称或指代医学问题的医学术语)关键决定了总体准确率。自动化词典开发具有可扩展性与准确性的潜力。
引用
@article{arxiv.1902.09674,
title = {Developing and Using Special-Purpose Lexicons for Cohort Selection from Clinical Notes},
author = {Samarth Rawal and Ashok Prakash and Soumya Adhya and Sidharth Kulkarni and Saadat Anwar and Chitta Baral and Murthy Devarakonda},
journal= {arXiv preprint arXiv:1902.09674},
year = {2019}
}
备注
13 pages, paper describing the NLP system built for N2C2 Task 1 2018 shared challenge in biomedical NLP