PANER:面向低资源场景的命名实体识别的措辞增强框架
计算与语言
2025-10-21 v1 人工智能
摘要
命名实体识别(NER)是需要大量标注数据才能完成的关键任务,在标注成本高昂的低资源场景中具有挑战性。虽然零样态和指令微调方法取得了进展,但它们往往难以泛化到特定领域的实体,且未能有效利用有限的可用数据。我们提出了一个轻量级的少样本NER框架,通过两种关键创新来解决这些挑战:(1)一种新的指令调优模板,采用简化的输出格式,综合了先前IT方法的原则,以利用最新SOTA大语言模型的大规模上下文窗口;(2)引入一种战略数据增强技术,通过改写上下文语境来保留实体信息,从而在不损害语义关系的前提下扩展训练数据。基准数据集上的实验表明,我们的方法在少样本和零样本任务上达到了与SOTA模型相当的性能,其中我们的少样本方法在CrossNER数据集上获得的平均F1分数为80.1。使用我们措辞增强方法训练的模型在F1分数上相对于基线版本提升了最高17分,为数据和计算资源有限的团队提供了有前景的解决方案。
引用
@article{arxiv.2510.17720,
title = {PANER: A Paraphrase-Augmented Framework for Low-Resource Named Entity Recognition},
author = {Nanda Kumar Rengarajan and Jun Yan and Chun Wang},
journal= {arXiv preprint arXiv:2510.17720},
year = {2025}
}