Twitter 中的命名实体识别:一个数据集及关于短期时间漂移的分析
计算与语言
2022-11-16 v2
摘要
语言模型预训练的最新进展带来了命名实体识别(NER)的重要改进。然而,这一进展主要在新闻、维基百科或科学文章等格式良好的文档中进行了测试。在社交媒体中情况有所不同,由于其噪声大且动态变化的特性,又增加了一层复杂性。在本文中,我们关注最大社交媒体平台之一的 Twitter 中的 NER,并构建了一个新的 NER 数据集 TweetNER7,该数据集包含从 2019 年 9 月到 2021 年 8 月标注的 11,382 条推文上的七种实体类型。该数据集是通过仔细按时间分布推文并以代表性趋势为基础构建的。除数据集外,我们提供了一组语言模型基线,并对语言模型在该任务上的性能进行了分析,特别分析了不同时间段的影响。具体而言,我们在分析中关注三个重要的时间方面:NER 模型随时间的短期退化、在不同时间段上微调语言模型的策略,以及作为缺乏近期标注数据替代方案的自标注。TweetNER7 已公开发布(https://huggingface.co/datasets/tner/tweetner7),连同在其上微调的模型一并放出。
引用
@article{arxiv.2210.03797,
title = {Named Entity Recognition in Twitter: A Dataset and Analysis on Short-Term Temporal Shifts},
author = {Asahi Ushio and Leonardo Neves and Vitor Silva and Francesco Barbieri and Jose Camacho-Collados},
journal= {arXiv preprint arXiv:2210.03797},
year = {2022}
}
备注
AACL 2022 main conference