Familiarity:量化合成训练数据中的标签漂移,提高零样本命名实体识别的评估
计算与语言
2025-03-10 v2
摘要
零样本命名实体识别(NER)是指在没有训练示例的情况下检测特定类型(如“Person”或“Medicine”)的命名实体的任务。当前研究越来越依赖大型合成数据集,这些数据集自动生成以覆盖数万种不同的实体类型,以训练零样本 NER 模型。然而,本文指出,这些合成数据集常包含与标准评估基准中实体类型在语义上高度相似(甚至相同)的实体类型。由于这种重叠,我们认为这些方法在标准评估基准上的报告 F1 分数会高估其实际能力。进一步地,我们认为当前的评估设置未能完整描绘零样本能力,因为它们未量化训练数据集和评估数据集之间标签漂移(即标签相似性)。为解决这些问题,我们提出了 Familiarity,一种新颖的度量标准,旨在捕捉训练和评估中实体类型的语义相似性以及其在训练数据中的频率,以提供标签漂移的估计。这使研究人员能够在使用自定义合成训练数据集时,对报告的零样本 NER 分数进行语境化。进一步,它使研究人员能够生成各种转移难度的评估设置,以进行零样本 NER 的细粒度分析。
引用
@article{arxiv.2412.10121,
title = {Familiarity: Better Evaluation of Zero-Shot Named Entity Recognition by Quantifying Label Shifts in Synthetic Training Data},
author = {Jonas Golde and Patrick Haller and Max Ploner and Fabio Barth and Nicolaas Jedema and Alan Akbik},
journal= {arXiv preprint arXiv:2412.10121},
year = {2025}
}
备注
9 pages, 4 figures, 5 tables