DANSK 与 DaCy 2.6.0:丹麦语命名实体识别的领域泛化
计算与语言
2024-02-29 v1
摘要
命名实体识别是丹麦语自然语言处理的基石之一,对于工业界和研究界的语言技术应用至关重要。然而,丹麦语命名实体识别受到可用数据集缺乏的制约。因此,目前的模型都无法进行细粒度的命名实体识别,也未曾评估其在不同数据集和领域间的潜在泛化问题。为缓解这些局限性,本文介绍了:1) DANSK:一个命名实体数据集,提供高粒度标注以及跨多样化领域的模型域内评估;2) DaCy 2.6.0,包含三个具有细粒度标注的可泛化模型;以及 3) 对当前最先进模型跨领域泛化能力的评估。对现有模型和新模型的评估揭示了跨领域的显著性能差异,这是该领域需要解决的问题。本文还讨论了数据集标注质量的缺陷及其对模型训练和评估的影响。尽管存在这些局限性,我们仍主张使用新的 DANSK 数据集,并进一步推动丹麦语命名实体识别领域的泛化研究。
引用
@article{arxiv.2402.18209,
title = {DANSK and DaCy 2.6.0: Domain Generalization of Danish Named Entity Recognition},
author = {Kenneth Enevoldsen and Emil Trenckner Jessen and Rebekah Baglini},
journal= {arXiv preprint arXiv:2402.18209},
year = {2024}
}