中文

融合 ChatGPT 与集成学习用于健康语料中不连续命名实体识别

计算与语言 2025-08-19 v3 人工智能

摘要

命名实体识别传统上是自然语言处理中的关键任务,旨在从非结构化文本数据中识别和提取重要术语。然而,当前深度学习 NER 模型面临的一个突出挑战是识别不连续实体,这些实体常在文本中被碎片化。迄今为止,针对不连续命名实体识别的方法尚未充分利用集成学习。此外,近年来大型语言模型如 ChatGPT 的兴起在诸多 NLP 任务中展现出显著效能。然而,现有方法主要将 ChatGPT 作为问题解决工具,而未探索其在集成学习算法中作为集成元素的潜力。本研究考察了将 ChatGPT 作为集成方法中的仲裁者,以提升 DNER 任务性能的可能性。我们的方法将五种最先进的 NER 模型与 ChatGPT 集成,通过定制的提示工程进行综合,以评估集成算法的鲁棒性和泛化能力。我们在三个基准医学数据集上进行实验,将方法与五个 SOTA 模型、单个 GPT-3.5 和 GPT-4 应用程序,以及投票集成方法进行比较。结果表明,我们提出的将 ChatGPT 与集成学习算法融合在 CADEC、ShARe13 和 ShARe14 数据集上超越了 SOTA 结果,展示了其在医疗保健领域增强 NLP 应用的潜力。

关键词

引用

@article{arxiv.2412.16976,
  title  = {On Fusing ChatGPT and Ensemble Learning in Discon-tinuous Named Entity Recognition in Health Corpora},
  author = {Tzu-Chieh Chen and Wen-Yang Lin},
  journal= {arXiv preprint arXiv:2412.16976},
  year   = {2025}
}

备注

13 pages; a short version named "Beyond GPT-NER: ChatGPT as Ensemble Arbitrator for Discontinuous Named Entity Recognition in Health Corpora" has been accpeted for presentation at MedInfo2025