改进从电子健康记录中提取临床事件上下文属性:一项比较研究
计算与语言
2024-09-02 v1
摘要
电子健康记录是宝贵临床数据的大型存储库,其中很大一部分以非结构化文本格式存储。这些文本数据包含上下文中的临床事件(如疾病、症状、检查结果、药物和程序),如果能大规模准确提取,将能解锁疾病预测等有价值的下游应用。使用现有的命名实体识别与链接方法 MedCAT,这些被识别出的概念需要进一步分类(上下文化),例如确定其与患者的相关性、时间状态和否定状态,以便在下游发挥作用。本研究对用于医学文本分类的各种自然语言模型进行了比较分析。大量实验表明,基于 Transformer 的语言模型,特别是 BERT 的有效性。结合类别不平衡缓解技术后,在少数类别的召回率上,BERT 比 Bi-LSTM 模型高出 28%,比基线 BERT 模型高出 16%。该方法已作为 CogStack/MedCAT 框架的一部分实现,并向社区开放以供进一步研究。
引用
@article{arxiv.2408.17181,
title = {Improving Extraction of Clinical Event Contextual Properties from Electronic Health Records: A Comparative Study},
author = {Shubham Agarwal and Thomas Searle and Mart Ratas and Anthony Shek and James Teo and Richard Dobson},
journal= {arXiv preprint arXiv:2408.17181},
year = {2024}
}