更好地泛化到未见概念:基于层次概念索引的评估框架与基于大语言模型的自动标注管线用于生物医学概念识别
计算与语言
2026-01-26 v1 信息检索
摘要
由于人工标注稀缺,泛化到未见概念是 Mention-agnostic 生物医学概念识别(MA-BCR)中的核心挑战。本工作作出两个关键贡献以系统性地解决此问题:第一,提出基于层次概念索引和新指标的评估框架,以衡量泛化能力;第二,探索基于大语言模型(LLM)的自动标注数据(ALD)作为可扩展资源,构建其生成的任务特定管线。我们的研究明确显示,尽管 LLM 生成的 ALD 无法完全替代人工标注,但它是改善泛化能力的有价值资源,成功为模型提供更广泛的覆盖范围和结构化知识,从而接近对未见概念的识别。代码和数据集已提供于 https://github.com/bio-ie-tool/hi-ald。
引用
@article{arxiv.2601.16711,
title = {Better Generalizing to Unseen Concepts: An Evaluation Framework and An LLM-Based Auto-Labeled Pipeline for Biomedical Concept Recognition},
author = {Shanshan Liu and Noriki Nishida and Fei Cheng and Narumi Tokunaga and Rumana Ferdous Munne and Yuki Yamagata and Kouji Kozaki and Takehito Utsuro and Yuji Matsumoto},
journal= {arXiv preprint arXiv:2601.16711},
year = {2026}
}
备注
Accepted to EACL 2026 (Main)