断言检测大型语言模型上下文学习 LoRA 微调
计算与语言
2024-02-01 v1
摘要
在这项研究中,我们旨在解决从临床笔记中提取医疗概念时的断言检测任务,这是临床自然语言处理(NLP)中的一个关键过程。临床 NLP 中的断言检测通常涉及识别临床文本中医疗概念的断言类型,即确定性(医疗概念是肯定的、否定的、可能的还是假设的)、时态性(医疗概念是当前的还是既往病史)以及经历者(医疗概念是描述患者的还是家庭成员的)。这些断言类型对于医疗专业人员快速清晰地从非结构化临床文本中理解医疗状况的背景至关重要,直接影响患者护理的质量和结果。尽管传统方法被广泛使用,特别是基于规则的 NLP 系统和机器学习或深度学习模型,但它们需要密集的手工劳动来创建模式,且往往忽略不常见的断言类型,导致对上下文的理解不完整。为了应对这一挑战,我们的研究引入了一种新方法,利用在海量医疗数据上预训练的大型语言模型进行断言检测。我们通过高级推理技术增强了当前方法,包括思维树、思维链和自洽性,并通过低秩适配微调对其进行了进一步优化。我们首先在 i2b2 2010 断言数据集上评估了该模型。我们的方法实现了 0.89 的微平均 F-1,比之前的工作提高了 0.11。为了进一步评估我们方法的泛化能力,我们将评估扩展到专注于睡眠概念提取的本地数据集。我们的方法实现了 0.74 的 F-1,比之前的方法高 0.31。
引用
@article{arxiv.2401.17602,
title = {Assertion Detection Large Language Model In-context Learning LoRA Fine-tuning},
author = {Yuelyu Ji and Zeshui Yu and Yanshan Wang},
journal= {arXiv preprint arXiv:2401.17602},
year = {2024}
}