中文

Twitter中语言变异的方言计量分析

计算与语言 2021-11-17 v1 信息检索 社会与信息网络 物理与社会

摘要

在过去几年中,Twitter等微博平台产生了海量文本数据,可用于分析数百万个体之间的非正式交流。在这项工作中,我们提出了一种基于Twitter语料库的地理语言变异信息论方法。我们使用数十个概念及其关联关键词(在西班牙境内地理定位的西班牙语推文中检测到)来测试我们的模型。我们采用方言计量测度(余弦相似度和Jensen-Shannon散度)来量化地图上均匀网格单元之间在词汇层面的语言距离。这可以针对单个概念进行,也可以在一般情况中考虑所考察变体的平均值。后者允许对数据中自然涌现的方言进行分析。有趣的是,我们的结果揭示了两种宏观方言变体的存在。第一组包括小城镇和农村地区使用的区域特定言语,而第二组则涵盖倾向于使用更统一变体的城市。由于使用两种不同度量得到的结果定性一致,我们的工作表明社交媒体语料库可以有效地用于方言计量分析。

关键词

引用

@article{arxiv.1702.06777,
  title  = {Dialectometric analysis of language variation in Twitter},
  author = {Gonzalo Donoso and David Sanchez},
  journal= {arXiv preprint arXiv:1702.06777},
  year   = {2021}
}

备注

10 pages, 7 figures, 1 table. Accepted to VarDial 2017