中文

基于 GPT 模型以最小指令进行零样本学习从临床笔记中抽取社会决定因素与家族史

计算与语言 2023-09-15 v2

摘要

记录在电子健康记录非结构化文本中的人口统计学信息、健康的社会决定因素和家族史,正日益被研究以了解这些信息如何与结构化数据结合使用从而改善医疗结果。在 GPT 模型发布后,许多研究已应用 GPT 模型从叙述性临床笔记中抽取此类信息。与现有工作不同,我们的研究侧重于通过向 GPT 模型提供最少信息,以零样本学习方式联合抽取这些信息。我们使用为人口统计学、各类社会决定因素和家族史信息标注的去标识化真实世界临床笔记。鉴于 GPT 模型可能生成不同于原始数据中文本的输出,我们探索了两组评估指标,包括传统的 NER 评估指标和语义相似度评估指标,以全面理解其性能。我们的结果表明,GPT-3.5 方法在人口统计学抽取上取得了平均 0.975 的 F1,在社会决定因素抽取上为 0.615 的 F1,在家族史抽取上为 0.722 的 F1。我们相信这些结果可通过模型微调或少样本学习进一步提升。通过案例研究,我们也识别了 GPT 模型的局限性,需在 future 研究中加以解决。

关键词

引用

@article{arxiv.2309.05475,
  title  = {Zero-shot Learning with Minimum Instruction to Extract Social Determinants and Family History from Clinical Notes using GPT Model},
  author = {Neel Bhate and Ansh Mittal and Zhe He and Xiao Luo},
  journal= {arXiv preprint arXiv:2309.05475},
  year   = {2023}
}

备注

5 pages, 4 figures