中文

Twitter 中语言模式的社会经济依赖性:一种多元分析

计算与语言 2018-04-05 v1 计算机与社会 社会与信息网络 物理与社会 机器学习

摘要

我们对语言的使用不仅仅依赖于认知,而且可以说由无数外部因素决定,从而导致语言模式的全球变异性。这一问题处于社会语言学的核心,并得到了许多关于面对面交流的小规模研究的支持,本文通过构建一个数据集来解决该问题,该数据集将迄今为止最大的法语 Twitter 语料库与从法国全国人口普查获得的详细社会经济地图相结合。我们展示了在个体 Twitter 流中测量的关键语言变量如何依赖于社会经济地位、位置、时间和个体社交网络等因素。我们发现:(i) 社会经济地位较高、在白天更活跃的人使用更标准的语言;(ii) 该国南部比北部更倾向于使用更标准的语言,而在局部上所使用的变体或方言由社会经济地位的空间分布决定;(iii) 即使在去除地位同质性效应后,社交网络中相连的个体在语言上比不相连的个体更相近。我们的结果为社会语言学理论提供了信息,并可能启发从推文方式推断人们社会经济地位的新学习方法。

关键词

引用

@article{arxiv.1804.01155,
  title  = {Socioeconomic Dependencies of Linguistic Patterns in Twitter: A Multivariate Analysis},
  author = {Jacob Levy Abitbol and Márton Karsai and Jean-Philippe Magué and Jean-Pierre Chevrot and Eric Fleury},
  journal= {arXiv preprint arXiv:1804.01155},
  year   = {2018}
}

备注

In WWW 2018: The Web Conference, 10 pages, 6 figures