中文

文本分析的多项式逆回归

统计方法学 2015-03-17 v7

摘要

文本数据,包括演讲、故事和其他文档形式,通常与营销、经济学及其他领域研究中感兴趣的情感变量相关联。它也是高维的,难以纳入统计分析。本文介绍了一个用于文本数据的保留情感降维的直观框架。多项式逆回归被引入作为简化可表示为从多项分布中抽取的预测变量集的通用工具,我们展示了短语计数对文档注释的逻辑回归可用于获得富含情感信息的低维文档表示。为了促进这种建模,针对具有非常高维响应的多项逻辑回归开发了一种新的估计技术。具体而言,为每个回归系数分配了具有未知方差的独立拉普拉斯先验,并详细介绍了最大化系数及其先验尺度联合后验的有效程序。这种“伽马-套索”方案为一般高维逻辑回归提供了稳定有效的估计,我们论证它在许多设置中将优于当前方法。提供了先验规范的指南,详细说明了算法收敛性,并从非凹似然惩罚文献的角度概述了估计量性质。调查并联系了统计学、计量经济学和机器学习中关于情感分析的相关工作。最后,该方法应用于两个详细示例,并提供了样本外预测研究以说明其有效性。

关键词

引用

@article{arxiv.1012.2098,
  title  = {Multinomial Inverse Regression for Text Analysis},
  author = {Matt Taddy},
  journal= {arXiv preprint arXiv:1012.2098},
  year   = {2015}
}

备注

Published in the Journal of the American Statistical Association 108, 2013, with discussion (rejoinder is here: http://arxiv.org/abs/1304.4200). Software is available in the textir package for R