DaCy:丹麦语自然语言处理统一框架
计算与语言
2021-07-13 v1 机器学习
摘要
丹麦语自然语言处理(NLP)近年来随着多个新数据集和模型的加入取得了显著改进。然而,目前尚无连贯的框架来应用丹麦语的最先进模型。我们提出 DaCy:一个基于 SpaCy 构建的丹麦语 NLP 统一框架。DaCy 使用高效的多任务模型,在命名实体识别、词性标注和依存句法分析上取得了最先进的性能。DaCy 包含易于集成现有模型的工具,例如用于极性、情感或主观性检测。此外,我们通过增广 DaNE 的测试集,对丹麦语 NLP 流水线进行了一系列偏差和鲁棒性测试。DaCy large 表现优越,尤其对长输入长度和拼写变体及错误具有鲁棒性。除 DaCy large 外的所有模型都显示出与族裔相关的显著偏差,而只有 Polyglot 显示出显著的性别偏差。我们认为,对于基准集有限的语言,数据增广对于获得更真实和细粒度的性能估计尤为有用。我们提供了一系列增广器,作为对低资源和中等资源语言的语言模型进行更彻底评估的第一步,并鼓励进一步发展。
引用
@article{arxiv.2107.05295,
title = {DaCy: A Unified Framework for Danish NLP},
author = {Kenneth Enevoldsen and Lasse Hansen and Kristoffer Nielbo},
journal= {arXiv preprint arXiv:2107.05295},
year = {2021}
}
备注
8 pages, 5 tables