使用标签比例学习从 Twitter 挖掘政治情感的人口统计学特征
社会与信息网络
2018-01-01 v1
摘要
意见挖掘和人口统计属性推断在社会科学中有许多应用。在本文中,我们提出了一些模型,用于从 Twitter 数据中推断多个潜在属性(如政治情感和人口统计属性)的每日联合概率。由于为传统监督分类标注数据既昂贵又耗时,我们转而提出可扩展的标签比例学习模型,利用美国人口普查、全国及州政治民意调查和 Cook 党派投票指数作为总体级数据,进行人口统计和意见推断。在 LLP 分类设置中,训练数据被划分为一组无标签袋,其中仅已知每个袋内的标签分布,从而去除了实例级标注的要求。我们提出的 LLP 模型——加权标签正则化,对先前关于标签正则化的工作进行了可扩展的推广,以支持袋内样本的权重,这适用于袋按层次排列的设置(例如,县级袋嵌套在州级袋内)。我们将模型应用于 2016 年美国总统大选前一年收集的 Twitter 数据,生成了政治情感与人口统计特征随时间和地点关系的估计。我们发现,该方法密切跟踪按人口统计类别分层的传统民意调查数据,与基线方法相比误差减少了 28-44%。我们还提供了描述性评估,展示了该模型如何用于估计多个变量之间的交互作用并识别语言的时间变化,这些能力通常是传统民意调查方法无法实现的。
引用
@article{arxiv.1708.08000,
title = {Mining the Demographics of Political Sentiment from Twitter Using Learning from Label Proportions},
author = {Ehsan Mohammady Ardehaly and Aron Culotta},
journal= {arXiv preprint arXiv:1708.08000},
year = {2018}
}