数据共享与重采样LASSO:基于词的IMDb数据情感分析
应用统计
2017-05-19 v2
摘要
本文研究使用带有新改进的LASSO的变量选择问题。LASSO使用惩罚,当解释变量个数远大于观测数时,它将大多数系数收缩为零。本文开发的方法的新颖之处在于将重采样与LASSO背后的基本思想相融合,从而在测试样本的均方误差方面提供了显著的变量缩减和预测精度提升。利用本文开发的基础方法Bootstrapped LASSO,探索了不同的加权方案。加权方案决定了在分组数据情况下数据混合的程度。[11]开发的数据共享(DSL)技术是当前方法的基础。我们将该技术应用于分析[11]中讨论的IMDb数据集,并将我们的结果与[11]进行比较。
引用
@article{arxiv.1705.05715,
title = {Data Sharing and Resampled LASSO: A word based sentiment Analysis for IMDb data},
author = {Ashutosh K. Maurya},
journal= {arXiv preprint arXiv:1705.05715},
year = {2017}
}
备注
18 pages