中文

高维下的稀有特征选择

统计方法学 2023-02-03 v3 统计理论 统计计算 机器学习 统计理论

摘要

在现代预测问题中,许多预测变量是罕见事件的计数,这很常见。这导致设计矩阵中许多列高度稀疏。尽管这种“稀有特征”带来的挑战在从自然语言处理(如稀有词)到生物学(如稀有物种)等多个领域普遍存在,但鲜少受到关注。我们从理论和经验上表明,不明确考虑特征的稀有性会大大降低分析的有效性。接下来,我们提出了一种以灵活方式将稀有特征聚合为更密集特征的框架,从而创建更好的响应预测变量。我们的策略利用树形式的辅助信息来编码特征相似性。我们将该方法应用于 TripAdvisor 数据,根据相关评论的文本预测酒店的数值评分。我们的方法通过有效利用稀有词实现了高准确率;相比之下,如果高预测性词过于稀有,lasso 将无法识别它们。一个名为 rare 的配套 R 包使用交替方向乘子法实现了我们的新估计器。

关键词

引用

@article{arxiv.1803.06675,
  title  = {Rare Feature Selection in High Dimensions},
  author = {Xiaohan Yan and Jacob Bien},
  journal= {arXiv preprint arXiv:1803.06675},
  year   = {2023}
}

备注

42 pages, 10 figures