面向社区社交媒体预测任务的残差化因子自适应
计算与语言
2019-04-17 v1
摘要
基于社交媒体语言的预测模型在捕捉社区结果方面已显示出前景,但迄今为止的方法很大程度上忽视了语言所属社区的社会人口背景(例如年龄、教育率、种族)。例如,假设阿拉巴马州莫比尔(人口相对偏老)的人们会像旧金山(年龄中位数更轻、大学教育率更高)的人们那样使用词语,可能是不准确的。在本文中,我们提出残差化因子自适应,一种面向社区预测任务的新方法,它既(a)有效整合社区属性,又(b)将语言特征自适应到社区属性(因子)。我们使用了十一项人口与经济社会属性,并在五项不同的社区级预测任务上评估了我们的方法,涵盖健康(心脏病死亡率、健康一般/较差百分比)、心理学(生活满意度)和经济学(房价上涨百分比、止赎率)。我们的评估表明,在纳入社会人口背景方面,残差化因子自适应相较先前最先进方法显著改善了5项社区级结果预测中的4项。
引用
@article{arxiv.1808.09479,
title = {Residualized Factor Adaptation for Community Social Media Prediction Tasks},
author = {Mohammadzaman Zamani and H. Andrew Schwartz and Veronica E. Lynn and Salvatore Giorgi and Niranjan Balasubramanian},
journal= {arXiv preprint arXiv:1808.09479},
year = {2019}
}
备注
Conference on Empirical Methods in Natural Language Processing (EMNLP 2018)