使用鲁棒主成分分析从地理标记的Twitter消息中估计语言使用的区域特征
计算与语言
2013-11-06 v1
摘要
主成分分析(PCA)及相关技术已成功应用于自然语言处理。在线社交媒体时代的文本挖掘应用面临着这些用例特有属性带来的新挑战(例如用户发布文本的拼写问题、垃圾邮件发送者和机器人的存在、服务公告等)。在本文中,我们采用鲁棒PCA技术,将典型的异常值和高度局部化的主题与在线社交网络语言使用中的低维结构分离开来。我们的重点是识别Twitter微博服务用户发布消息中的地理空间特征。使用一个包含一年内收集的超过2亿条地理标记推文的数据集,我们研究了词频信息是否可用于识别语言使用的区域特征和感兴趣的主题。通过PCA追踪方法,我们能够识别重要的低维特征,这些特征构成了地理位置的平滑变化函数。
引用
@article{arxiv.1311.1169,
title = {Using Robust PCA to estimate regional characteristics of language use from geo-tagged Twitter messages},
author = {Dániel Kondor and István Csabai and László Dobos and János Szüle and Norbert Barankai and Tamás Hanyecz and Tamás Sebők and Zsófia Kallus and Gábor Vattay},
journal= {arXiv preprint arXiv:1311.1169},
year = {2013}
}