中文

ALLabel:基于示例检索的LLM实体识别三阶段主动学习框架

计算与语言 2025-09-10 v1 人工智能 信息检索

摘要

自然科学(如化学和材料科学)中许多当代数据驱动的研究工作,都需要从科学数据集中进行大规模、高性能的实体识别。大型语言模型(LLM)已越来越多地被用于解决实体识别任务,在全谱系NLP任务中也观察到了同样的趋势。主流的实体识别LLM依赖于微调技术,然而微调过程通常会产生高昂的成本。为了实现最佳的性能-成本权衡,我们提出了ALLabel,这是一个三阶段框架,旨在为LLM建模准备示例时选择信息量最大且最具代表性的样本。标注后的样本用于构建一个用于LLM上下文学习的真实检索语料库。通过顺序采用三种不同的主动学习策略,ALLabel在三个专业领域数据集上,在相同的标注预算下,始终优于所有基线方法。实验结果还表明,使用ALLabel仅选择性标注5%-10%的数据集,就能达到与标注整个数据集的方法相当的性能。进一步的分析和消融研究验证了我们方案的有效性和泛化性。

关键词

引用

@article{arxiv.2509.07512,
  title  = {ALLabel: Three-stage Active Learning for LLM-based Entity Recognition using Demonstration Retrieval},
  author = {Zihan Chen and Lei Shi and Weize Wu and Qiji Zhou and Yue Zhang},
  journal= {arXiv preprint arXiv:2509.07512},
  year   = {2025}
}