语言变迁的统计显著性检测
计算与语言
2014-11-13 v1 信息检索
机器学习
摘要
我们提出了一种新的计算方法,用于追踪和检测词语含义及用法中具有统计显著性的语言变迁。此类语言变迁在互联网上尤为普遍,因为思想的快速交流能迅速改变词义。我们的元分析方法构建了词语用法的属性时间序列,随后使用统计可靠的变点检测算法来识别显著的语言变迁。我们考虑并分析了三种复杂度递增的方法来生成此类语言属性时间序列,其最终成果是利用从词语共现中推断出的分布特征。利用最近提出的深度神经语言模型,我们首先为每个时间段训练词语的向量表示。其次,我们将向量空间扭曲到一个统一的坐标系中。最后,我们为每个词语构建基于距离的分布时间序列,以追踪其随时间的语言位移。我们通过利用 Twitter 追踪多年的微博客语言变迁、利用亚马逊电影评论语料库追踪十年的产品评论变迁,以及利用 Google Book-ngrams 追踪一个世纪的书面书籍变迁,证明了该方法的可扩展性。我们的分析揭示了与每种媒介相称的语言用法变迁的有趣模式。
引用
@article{arxiv.1411.3315,
title = {Statistically Significant Detection of Linguistic Change},
author = {Vivek Kulkarni and Rami Al-Rfou and Bryan Perozzi and Steven Skiena},
journal= {arXiv preprint arXiv:1411.3315},
year = {2014}
}
备注
11 pages, 7 figures, 4 tables