SemEval-2023 任务 2:细粒度多语言命名实体识别(MultiCoNER 2)
计算与语言
2023-05-26 v2 人工智能
摘要
我们呈现 SemEval-2023 任务 2 关于细粒度多语言命名实体识别(MultiCoNER 2)的发现。该任务分为 13 个赛道,聚焦于在单语言与多语言场景以及噪声设置下,跨 12 种语言识别复杂细粒度命名实体(如 WRITTENWORK、VEHICLE、MUSICALGRP)的方法。任务使用了 MultiCoNER V2 数据集,包含孟加拉语、汉语、英语、波斯语、法语、德语、印地语、意大利语、葡萄牙语、西班牙语、瑞典语和乌克兰语共 220 万实例。MultiCoNER 2 是 SemEval-2023 最受欢迎的任务之一。它吸引了来自 47 支队伍的 842 份提交,34 支队伍提交了系统论文。结果表明,媒体标题与产品名称等复杂实体类型最具挑战性。将外部知识融合进 transformer 模型的方法取得了最佳性能,且在 Creative Work 与 Group 类上收益最大,但即便借助外部知识仍具挑战。一些细粒度类被证明较其他类更具挑战性,如 SCIENTIST、ARTWORK 与 PRIVATECORP。我们还观察到噪声数据对模型性能有显著影响,在噪声子集上平均下降 10%。该任务凸显了未来研究改进含复杂实体的噪声数据上 NER 鲁棒性的必要。
引用
@article{arxiv.2305.06586,
title = {SemEval-2023 Task 2: Fine-grained Multilingual Named Entity Recognition (MultiCoNER 2)},
author = {Besnik Fetahu and Sudipta Kar and Zhiyu Chen and Oleg Rokhlenko and Shervin Malmasi},
journal= {arXiv preprint arXiv:2305.06586},
year = {2023}
}
备注
SemEval-2023 (co-located with ACL-2023 in Toronto, Canada)