中文

一种面向鲁棒 Reddit 词性标注的跨体裁集成方法

计算与语言 2020-04-30 v1

摘要

词性标注是一项基础 NLP 任务,常被视为对英语等高资源语言已解决。当前 state-of-the-art 模型已取得高准确率,尤其在新闻领域。然而,当这些模型应用于具有不同体裁的其他语料,特别是来自 Web 的用户生成数据时,性能出现显著下降。本工作中,我们研究在多种体裁上训练的 state-of-the-art 标注模型在未经过滤的 Reddit 论坛讨论这一 Web 内容上的表现。更具体地,我们使用来自多个来源的数据:OntoNotes,一个具有“精心编辑”文本的大型基准语料;English Web Treebank,含 5 种 Web 体裁;以及 GUM,含除 Reddit 外另 7 种体裁。我们报告了在不同数据划分上训练并在 Reddit 上测试的结果。我们的结果表明,即便少量的领域内数据也能胜过来自其他 Web 领域大一个数量级的数据的贡献。为推进域外标注,我们还评估了一种集成方法,使用多个单体裁标注器作为元分类器的输入特征。我们展示了在 Reddit 数据标注上的 state-of-the-art 性能,以及这些模型结果的错误分析,并给出了其中最常见错误类型的分类法,按训练语料细分。

关键词

引用

@article{arxiv.2004.14312,
  title  = {A Cross-Genre Ensemble Approach to Robust Reddit Part of Speech Tagging},
  author = {Shabnam Behzad and Amir Zeldes},
  journal= {arXiv preprint arXiv:2004.14312},
  year   = {2020}
}

备注

Proceedings of the 12th Web as Corpus Workshop (WAC-XII)