基于生成式AI与合成笔记的跨机构牙科电子健康记录实体抽取
计算与语言
2025-06-04 v3
摘要
本研究针对牙科记录中结构化数据缺失的问题,通过从非结构化文本中抽取诊断信息来进行诊断。更新的期ontology 分类系统的复杂性导致结构化诊断 incomplete 或缺失。为解决此问题,我们使用先进的AI与NLP方法,利用GPT-4生成合成笔记以微调RoBERTa模型。这显著增强了模型理解医学和牙科语言的能力。我们采用两种数据集中随机抽取的120个临床笔记进行评估,结果显示在牙周状态、阶段和分级诊断方面准确率极高,Site 1得分0.99,Site 2得分0.98。在亚型类别中,Site 2实现了完美分数,优于Site 1。这一方法提升了抽取准确性,拓宽了牙科场景的适用性。该研究凸显了AI与NLP在医疗保健交付与管理中的变革性影响。将AI与NLP技术集成可提升文档撰写,简化行政任务,通过精准抽取复杂临床信息来实现此目标。该方法有效解决了牙科诊断中的挑战。利用LLM生成的合成训练数据优化了训练过程,提高了从临床笔记中识别牙周诊断的准确性与效率。这一创新方法为更广泛的医疗保健应用奠定了基础, potentially improving patient care quality。
引用
@article{arxiv.2407.21050,
title = {Cross-Institutional Dental EHR Entity Extraction via Generative AI and Synthetic Notes},
author = {Yao-Shun Chuang and Chun-Teh Lee and Oluwabunmi Tokede and Guo-Hao Lin and Ryan Brandon and Trung Duong Tran and Xiaoqian Jiang and Muhammad F. Walji},
journal= {arXiv preprint arXiv:2407.21050},
year = {2025}
}
备注
11 pages, 2 tables, 3 figures, under review