中文

基于词特征的低维线性分类器学习:采用数据共享自适应自助聚合 Lasso 及其在 IMDb 数据中的应用

机器学习 2018-07-31 v2 信息检索 机器学习

摘要

本文提出一种称为数据共享自适应自助聚合(AdaBag)Lasso 的新型监督集成学习方法,用于捕捉基于词的情感分析与挖掘问题中的低维有用特征。关于集成方法的文献在统计学和机器学习中都非常丰富。该算法是对数据共享 Lasso 提升算法的实质性升级。对现有文献最显著的概念性补充在于通过一种特殊的自助聚合方案最终筛选预测变量袋。我们将该算法应用于一组模拟数据,并在分组的 IMDb 数据(剧情、喜剧和恐怖)中进行降维,提取出用于预测影评情感评分的精简词特征集,以展示不同方面。我们还将本方法的性能与作为基线的经典主成分联合线性判别(PCA-LD)进行比较。该算法存在若干局限。首先,算法流程未纳入在线顺序数据获取,且未使用 ANN 算法中常见的基于句子的模型。作为结果,我们的错误率略高于已报道的当前最优(state-of-the-art)。

关键词

引用

@article{arxiv.1807.10623,
  title  = {Learning low dimensional word based linear classifiers using Data Shared Adaptive Bootstrap Aggregated Lasso with application to IMDb data},
  author = {Ashutosh K. Maurya},
  journal= {arXiv preprint arXiv:1807.10623},
  year   = {2018}
}

备注

arXiv admin note: text overlap with arXiv:1204.1177 by other authors