中文

如何处理自然语言处理中的非标准(或非规范)语言

计算与语言 2016-08-30 v1

摘要

真实世界的数据与我们在自然语言处理(NLP)中使用的基准语料库截然不同。一旦我们将技术应用于真实世界,性能就会下降。这个问题的原因显而易见:NLP模型是在有限的一组被视为标准的规范变体样本上训练的,最显著的是英语新闻电讯。然而,文本在许多维度上(例如社会人口统计、语言、体裁、句子类型等)都可能与标准存在差异。解决方案并不明显:我们无法控制所有因素,而且目前尚不清楚如何最好地超越当前在单一领域和语言的同质数据上训练的做法。在本文中,我回顾了规范性的概念,以及它如何塑造了我们社区处理语言的方式。我主张利用我称之为偶然数据的东西,即迄今为止被忽视、隐藏在眼前或需要提炼的原始数据中的非显而易见的数据。如果我们通过将这种异构数据与适当的算法相结合来拥抱其多样性,我们不仅会生成更稳健的模型,还将使自适应语言技术能够处理自然语言变异。

关键词

引用

@article{arxiv.1608.07836,
  title  = {What to do about non-standard (or non-canonical) language in NLP},
  author = {Barbara Plank},
  journal= {arXiv preprint arXiv:1608.07836},
  year   = {2016}
}

备注

KONVENS 2016