中文

结合 RoBERTa 与正则表达式从临床笔记中提取牙周炎诊断

人工智能 2023-11-21 v1

摘要

本研究旨在利用文本处理与自然语言处理(NLP)模型挖掘临床笔记中的牙周炎诊断,并评估命名实体识别(NER)模型在不同正则表达式(RE)方法上的性能。采用两种复杂度的 RE 方法提取并生成训练数据。使用 SpaCy 包与 RoBERTa transformer 模型构建 NER 模型,并以人工标注金标准评估其性能。RE 方法与金标准比较显示,随着 RE 算法复杂度提升,F1 分数从 0.3–0.4 增至约 0.9。NER 模型展现出优异预测,简单 RE 方法评价指标为 0.84–0.92,进阶与组合 RE 方法评估中为 0.95–0.99。本研究提供了将 NER 方法与 NLP 模型结合以从自由文本提取目标信息至结构化数据、并补足非结构化笔记中缺失诊断需求的一个实例。

关键词

引用

@article{arxiv.2311.10809,
  title  = {Extracting periodontitis diagnosis in clinical notes with RoBERTa and regular expression},
  author = {Yao-Shun Chuang and Chun-Teh Lee and Ryan Brandon and Trung Duong Tran and Oluwabunmi Tokede and Muhammad F. Walji and Xiaoqian Jiang},
  journal= {arXiv preprint arXiv:2311.10809},
  year   = {2023}
}

备注

IEEE ICHI 2023, see https://ieeeichi.github.io/ICHI2023/program.html