我们对最先进 NER 究竟了解多少
计算与语言
2022-05-05 v2 人工智能
摘要
命名实体识别(NER)是一项研究充分的 NLP 任务,并广泛应用于现实世界 NLP 场景。NER 研究通常聚焦于创建训练 NER 的新方法,对资源和评估的重视相对较少。此外,在标准数据集上训练的最先进(SOTA)NER 模型通常仅报告单一性能指标(F 值),而我们并不真正了解它们对不同实体类型和文本体裁的表现如何,或它们对新、未见实体的鲁棒性如何。在本文中,我们使用一个流行数据集对 NER 进行广泛评估,该评估考虑了构成手头数据集的各种文本体裁和来源。此外,我们通过在原始测试集中进行微小扰动、替换选定实体同时保留上下文,生成了六个新的对抗测试集。我们还在随机生成的训练/验证/测试划分上训练和测试模型,并开展一项实验:模型在选定体裁上训练但在训练未见的体裁上测试。这些综合评估策略使用三个 SOTA NER 模型执行。基于我们的结果,我们向 NER 研究者推荐一些有用的报告实践,有助于未来更好地理解 SOTA 模型的性能。
引用
@article{arxiv.2205.00034,
title = {What do we Really Know about State of the Art NER?},
author = {Sowmya Vajjala and Ramya Balasubramaniam},
journal= {arXiv preprint arXiv:2205.00034},
year = {2022}
}
备注
LREC 2022