中文

LLM 在临床文本上的关系抽取能力:英语与土耳其语的双语评估

计算与语言 2026-01-15 v1

摘要

非英语语言临床信息抽取标注数据集的稀缺,阻碍了对主要在英语上开发的大语言模型方法的评估。在本研究中,我们首次对英语和土耳其语的 LLM 临床关系抽取任务进行了全面的双语评估。为了促进这一评估,我们引入了首个英土平行临床关系抽取数据集,该数据集源自 2010 i2b2/VA 关系分类语料库并经过精心筛选。我们系统评估了多种提示策略,包括多种上下文学习和思维链方法,并比较了它们与 PURE 等微调基线的性能。此外,我们提出了关系感知检索,一种基于对比学习的上下文示例选择新方法,专门设计用于捕获句子级和关系级语义。我们的结果表明,基于提示的 LLM 方法始终优于传统的微调模型。此外,在所有评估的 LLM 和提示技术中,英语评估的表现均优于其土耳其语对应评估。在 ICL 方法中,RAR 取得了最高性能,其中 Gemini 1.5 Flash 在英语中达到 0.906 的 micro-F1 分数,在土耳其语中达到 0.888。当 RAR 与使用 DeepSeek-V3 模型的结构化推理提示相结合时,英语中的 F1 分数进一步提升至 0.918。这些发现突出了高质量演示检索的重要性,并强调了高级检索和提示技术在弥合临床自然语言处理资源差距方面的潜力。

关键词

引用

@article{arxiv.2601.09367,
  title  = {Relation Extraction Capabilities of LLMs on Clinical Text: A Bilingual Evaluation for English and Turkish},
  author = {Aidana Aidynkyzy and Oğuz Dikenelli and Oylum Alatlı and Şebnem Bora},
  journal= {arXiv preprint arXiv:2601.09367},
  year   = {2026}
}