CAp 2017 挑战赛:Twitter 命名实体识别
计算与语言
2017-07-25 v1
摘要
本文描述了 CAp 2017 挑战赛。该挑战赛涉及针对法语推文的命名实体识别(NER)问题。我们首先介绍了为构建在挑战赛框架下发布的数据集而遵循的数据准备步骤。我们首先论证了为什么推文的 NER 是一个具有挑战性的问题,特别是当实体数量增加时。我们详细说明了标注过程及我们做出的必要决定。我们提供了关于标注者间一致性的统计数据,并以数据的示例和统计数据结束数据描述部分。然后,我们描述了挑战赛的参与情况,共有 8 个团队参与,重点介绍了挑战赛参与者所采用的方法及其在 F 测度方面取得的分数。重要的是,所构建的数据集包含约 6,000 条推文,标注了 13 种实体类型,据我们所知这是首个此类法语数据集,该数据集已在 \url{http://cap2017.imag.fr/competition.html} 公开提供。
引用
@article{arxiv.1707.07568,
title = {CAp 2017 challenge: Twitter Named Entity Recognition},
author = {Cédric Lopez and Ioannis Partalas and Georgios Balikas and Nadia Derbas and Amélie Martin and Coralie Reutenauer and Frédérique Segond and Massih-Reza Amini},
journal= {arXiv preprint arXiv:1707.07568},
year = {2017}
}
备注
Presented at CAp 2017 (French Conference on Machine Learning)