中文

Freshman还是Fresher?量化互联网语言的地理变异

计算与语言 2016-03-08 v2 信息检索 机器学习

摘要

我们提出一种新的计算技术,用于检测和分析语言中统计显著的地理变异。我们的元分析方法捕捉跨地理区域的用词统计特性,并使用统计方法识别特定于区域的显著变化。先前的方法主要关注区域间的词汇变异,而我们的方法也识别表现出语义和句法变异的词语。我们扩展了最近开发的神经语言模型技术,以学习捕捉不同地理区域语义差异的词表示。为了量化这种变异并确保对真实区域差异的稳健检测,我们构建了一个零模型以确定观察到的变化是否在统计上显著。我们的方法是首个在检测词义区域变异时显式考虑随机偶然变化的方法。为验证我们的模型,我们研究并分析了两个不同的大规模在线数据集:来自Twitter的数百万条推文,覆盖四个不同国家及五十个州,以及Google Book Ngrams中的数百万条短语。我们的分析揭示了多尺度地理分辨率下语言变化的有趣方面——从邻近州到遥远大陆。最后,利用我们的模型,我们提出了一种语言间语义距离的度规。我们对英式与美式英语历时100年的分析表明,这些方言间的语义变异正在缩小。

关键词

引用

@article{arxiv.1510.06786,
  title  = {Freshman or Fresher? Quantifying the Geographic Variation of Internet Language},
  author = {Vivek Kulkarni and Bryan Perozzi and Steven Skiena},
  journal= {arXiv preprint arXiv:1510.06786},
  year   = {2016}
}

备注

11 pages (updated submission)