中文

LLM 的合成数据生成有助于临床文本挖掘吗?

计算与语言 2023-04-12 v2 人工智能 机器学习

摘要

大语言模型 (LLMs) 的近期进展催生了如 OpenAI 的 ChatGPT 等极强模型。这些模型在问答、作文与代码生成等多种任务中展现出卓越性能。然而,它们在医疗健康领域的有效性仍不确定。本研究旨在通过考察 ChatGPT 从非结构化医疗文本中抽取结构化信息的能力,聚焦于生物命名实体识别与关系抽取,来探究其辅助临床文本挖掘的潜力。但我们的初步结果表明,直接将 ChatGPT 用于这些任务性能较差,并引发了将患者信息上传至 ChatGPT API 的隐私担忧。为克服这些局限,我们提出了一种新训练范式:利用 ChatGPT 生成大量带标签的高质量合成数据,并微调本地模型用于下游任务。我们的方法显著提升了下游任务性能,将命名实体识别任务的 F1 分数从 23.37% 提高到 63.99%,关系抽取任务从 75.86% 提高到 83.59%。此外,使用 ChatGPT 生成数据可大幅减少数据收集与标注所需的时间和精力,并缓解数据隐私担忧。总之,所提框架为增强 LLM 模型在临床文本挖掘中的适用性提供了一个有前景的解决方案。

关键词

引用

@article{arxiv.2303.04360,
  title  = {Does Synthetic Data Generation of LLMs Help Clinical Text Mining?},
  author = {Ruixiang Tang and Xiaotian Han and Xiaoqian Jiang and Xia Hu},
  journal= {arXiv preprint arXiv:2303.04360},
  year   = {2023}
}

备注

10 pages, 8 tables, 4 figures