基于大语言模型的临床数据生成的两个方向:数据到标签与标签到数据
计算与语言
2024-02-23 v1
摘要
大语言模型(LLMs)能够为各种领域和任务生成自然语言文本,但其在临床文本挖掘领域的潜力尚未得到充分探索,该领域医疗数据稀缺、敏感且不平衡。我们研究了 LLMs 是否能够增强临床数据,用于从电子健康记录(EHRs)中检测阿尔茨海默病(AD)相关的体征和症状,这是一项需要高度专业知识的挑战性任务。我们基于专家知识创建了一个新颖且实用的 AD 体征和症状进展分类法,该分类法指导 LLMs 沿两个不同方向生成合成数据:“数据到标签”,即用 AD 相关体征和症状标记来自公共 EHR 集合的句子;“标签到数据”,即基于标签定义生成带有 AD 相关体征和症状的句子。我们使用三个数据集训练了一个从 EHRs 中检测 AD 相关体征和症状的系统:(1)由人类专家在 AD 患者纵向 EHRs 上标注的金标准数据集;(2)通过数据到标签方法创建的银标准数据集;(3)通过标签到数据方法创建的铜标准数据集。我们发现,使用银标准和铜标准数据集提高了系统性能,优于仅使用金标准数据集的系统。这表明 LLMs 可以通过整合专家知识为复杂任务生成合成临床数据,并且我们的标签到数据方法能够生成不含敏感信息的数据集,同时保持可接受的质量。
引用
@article{arxiv.2401.06774,
title = {Two Directions for Clinical Data Generation with Large Language Models: Data-to-Label and Label-to-Data},
author = {Rumeng Li and Xun Wang and Hong Yu},
journal= {arXiv preprint arXiv:2401.06774},
year = {2024}
}
备注
Appear in EMNLP2023 Findings