中文

LLM,报告到!基于提示、微调和后校正的医疗信息提取

计算与语言 2025-10-07 v1 信息检索

摘要

本工作呈现我们在EvalLLM 2025挑战中参赛情况,该挑战聚焦于法语医疗信息提取中的命名实体识别(NER)和健康事件抽取(few-shot setting)。对于NER,我们提出了三种结合大语言模型(LLM)、注释指南、合成数据和后处理的策略:(1)基于GPT-4.1的原地学习(in-context learning, ICL),将自动选择10个示例及注释指南摘要纳入提示;(2)通用NER系统GLiNER在合成语料库上进行微调后,通过LLM进行后处理验证;(3)开源LLM LLaMA-3.1-8B-Instruct在相同的合成语料库上进行微调。事件抽取采用相同的ICL策略,复用指南摘要于提示中。结果显示,GPT-4.1在NER上取得61.53%的宏平均F1分,事件抽取为15.02%,凸显在极低资源场景中精心设计的提示对最大化性能的重要性。

关键词

引用

@article{arxiv.2510.03577,
  title  = {LLM, Reporting In! Medical Information Extraction Across Prompting, Fine-tuning and Post-correction},
  author = {Ikram Belmadani and Parisa Nazari Hashemi and Thomas Sebbag and Benoit Favre and Guillaume Fortier and Solen Quiniou and Emmanuel Morin and Richard Dufour},
  journal= {arXiv preprint arXiv:2510.03577},
  year   = {2025}
}

备注

in French language