ESNERA:面向命名实体数据集合并的经验与语义命名实体对齐
计算与语言
2025-08-12 v1 人工智能
摘要
命名实体识别(NER)是自然语言处理中的一项基础任务。由于其跨领域的广泛适用性,它仍然是一个研究热点。尽管深度学习的最新进展显著提升了NER的性能,但这些进展严重依赖于大规模、高质量的标注数据集。然而,构建这些数据集既昂贵又耗时,构成了进一步研究的主要瓶颈。当前的数据集合并方法主要侧重于人工标签映射或构建标签图等策略,这些策略缺乏可解释性和可扩展性。为解决这一问题,我们提出了一种基于标签相似度的自动标签对齐方法。该方法结合了经验相似度和语义相似度,采用贪心成对合并策略来统一不同数据集间的标签空间。实验分两个阶段进行:首先,将三个现有的NER数据集合并为一个统一的语料库,对NER性能的影响极小;其次,将该语料库与一个自建的小规模金融领域数据集进行整合。结果表明,我们的方法能够实现有效的数据集合并,并提升了低资源金融领域的NER性能。本研究为整合多源NER语料库提供了一种高效、可解释且可扩展的解决方案。
引用
@article{arxiv.2508.06877,
title = {ESNERA: Empirical and semantic named entity alignment for named entity dataset merging},
author = {Xiaobo Zhang and Congqing He and Ying He and Jian Peng and Dajie Fu and Tien-Ping Tan},
journal= {arXiv preprint arXiv:2508.06877},
year = {2025}
}
备注
30 pages, 12 figures