监督微调或情境学习?评估临床命名实体识别中的 LLM
计算与语言
2025-10-28 v1 人工智能
摘要
我们研究了在 CADEC 语料库上进行临床命名实体识别 (NER),并比较了三类方法:(i) BERT 风格的编码器 (BERT Base、BioClinicalBERT、RoBERTa-large),(ii) 在简单提示与复杂提示下使用 few-shot情境学习的 GPT-4o,以及 (iii) 使用监督微调 (SFT) 的 GPT-4o。所有模型都在 CADEC 的五个实体类型 (ADR、药物、疾病、症状、发现) 上进行标准 NER 指标评估。RoBERTa-large 和 BioClinicalBERT 相对于 BERT Base 提供的改进有限,显示出这些模型家族的局限性。在 LLM 设置中,简单情境学习优于较长的、充满指令的提示,而 SFT 实现了最强的整体性能 (F1 ≈ 87.1%),尽管成本更高。我们发现,LLM 在简化任务上获得更高的准确率,这些任务将分类限制为两个标签。
引用
@article{arxiv.2510.22285,
title = {Supervised Fine-Tuning or In-Context Learning? Evaluating LLMs for Clinical NER},
author = {Andrei Baroian},
journal= {arXiv preprint arXiv:2510.22285},
year = {2025}
}
备注
Work done in November - December 2024