高维下的稀有特征选择
统计方法学
2023-02-03 v3 统计理论
统计计算
机器学习
统计理论
摘要
在现代预测问题中,许多预测变量是罕见事件的计数,这很常见。这导致设计矩阵中许多列高度稀疏。尽管这种“稀有特征”带来的挑战在从自然语言处理(如稀有词)到生物学(如稀有物种)等多个领域普遍存在,但鲜少受到关注。我们从理论和经验上表明,不明确考虑特征的稀有性会大大降低分析的有效性。接下来,我们提出了一种以灵活方式将稀有特征聚合为更密集特征的框架,从而创建更好的响应预测变量。我们的策略利用树形式的辅助信息来编码特征相似性。我们将该方法应用于 TripAdvisor 数据,根据相关评论的文本预测酒店的数值评分。我们的方法通过有效利用稀有词实现了高准确率;相比之下,如果高预测性词过于稀有,lasso 将无法识别它们。一个名为 rare 的配套 R 包使用交替方向乘子法实现了我们的新估计器。
引用
@article{arxiv.1803.06675,
title = {Rare Feature Selection in High Dimensions},
author = {Xiaohan Yan and Jacob Bien},
journal= {arXiv preprint arXiv:1803.06675},
year = {2023}
}
备注
42 pages, 10 figures