中文

用于从非结构化医疗数据中提取数据的零样本学习自然语言处理工具的验证

计算与语言 2023-08-02 v1 人工智能

摘要

目的:描述一种零样本学习自然语言处理(NLP)工具的开发与验证,该工具用于从PDF文档内的非结构化文本(如电子健康记录中的文本)中提取数据。材料与方法:开发了一个基于OpenAI的GPT-3.5模型的的数据提取工具,并在任务完成时间和准确性方面与三名医师人工提取者进行比较,从一组199份去标识的根治性前列腺切除病理报告中提取14个独立变量的数据。软件工具以矢量化和扫描格式处理报告,以确定光学字符识别对数据提取的影响。评估该工具在数据提取速度上的优效性以及在准确性上的非劣效性。结果:人工提取者提取数据平均每份报告需101秒,时间从15到284秒不等。相比之下,软件工具处理矢量化报告平均需12.8秒,处理扫描报告平均需15.8秒(P < 0.001)。三名人工提取者在合计2786个数据点上的总体准确率分别为94.7%、97.8%和96.4%。软件工具对矢量化报告的总体准确率为94.2%,在-10%边际下(α\alpha=0.025)证明非劣于人工提取者。该工具对扫描报告的准确率略低,为88.7%,证明非劣于3名中的2名人工提取者。结论:所开发的零样本学习NLP工具提供与人工提取者相当的准确性水平,并具有显著的时间节省益处。由于无需任务特定的模型训练,所开发工具具有高度泛化性,可用于多种数据提取任务,甚至医学领域之外。

关键词

引用

@article{arxiv.2308.00107,
  title  = {Validation of a Zero-Shot Learning Natural Language Processing Tool for Data Abstraction from Unstructured Healthcare Data},
  author = {Basil Kaufmann and Dallin Busby and Chandan Krushna Das and Neeraja Tillu and Mani Menon and Ashutosh K. Tewari and Michael A. Gorin},
  journal= {arXiv preprint arXiv:2308.00107},
  year   = {2023}
}

备注

10 pages, 3 figures, 1 table, 3 supplementary figures