标注Tweebank语料库以进行命名实体识别并构建社交媒体分析NLP模型
计算与语言
2022-05-11 v2
摘要
诸如Twitter消息(“推文”)之类的社交媒体数据因其简短、嘈杂和口语化的性质,对NLP系统提出了特殊挑战。诸如命名实体识别(NER)和句法解析等任务需要高度领域匹配的训练数据才能取得良好性能。迄今为止,尚不存在同时用于推文NER和句法分析(例如词性标注、依存解析)的完整训练语料库。虽然有一些公开可用的标注推文NLP数据集,但它们仅针对单个任务设计。在本研究中,我们旨在创建基于Tweebank V2(TB2)的英语NER语料库Tweebank-NER,在TB2上训练最先进(SOTA)的推文NLP模型,并发布称为Twitter-Stanza的NLP流水线。我们使用Amazon Mechanical Turk标注TB2中的命名实体,并衡量标注质量。我们在TB2上训练Stanza流水线,并与替代NLP框架(例如FLAIR、spaCy)和基于transformer的模型进行比较。Stanza分词器和 lemmatizer 在TB2上达到SOTA性能,而Stanza的NER标注器、词性(POS)标注器和依存解析器相对于非transformer模型具有竞争力。基于transformer的模型在Tweebank-NER中建立了强基线,并在TB2的词性标注和依存解析上取得了新的SOTA性能。我们发布该数据集,并使Stanza流水线和基于BERTweet的模型可“开箱即用”以供未来推文NLP研究使用。我们的源代码、数据和预训练模型可在:\url{https://github.com/social-machines/TweebankNLP}获取。
引用
@article{arxiv.2201.07281,
title = {Annotating the Tweebank Corpus on Named Entity Recognition and Building NLP Models for Social Media Analysis},
author = {Hang Jiang and Yining Hua and Doug Beeferman and Deb Roy},
journal= {arXiv preprint arXiv:2201.07281},
year = {2022}
}
备注
Accepted at LREC 2022 (Long Papers)