中文

高阶交互模型上高效的选后推断

机器学习 2015-06-29 v1

摘要

在预测建模中寻找统计显著的高阶交互特征是一项重要但具挑战性的任务。困难在于,对于具有高维协变量的近期应用,可能的高阶交互特征数量极其庞大。从如此巨大的候选池中识别统计显著特征在计算与统计意义上都极具挑战。为处理此问题,我们考虑一个两阶段算法:首先通过边际筛选选择一组高阶交互特征,然后对仅用所选特征拟合的回归模型进行统计推断。此类统计推断称为选后推断(PSI),在文献中受到越来越多关注。PSI文献中一个开创性近期进展是Lee等人的工作,他们给出了计算PSI中精确抽样分布的算法框架。将其方法应用于我们的高阶交互模型时,一个主要挑战是应对以下事实:PSI通常不仅依赖于所选特征,还依赖于未选特征,这使其难以应用于我们极高维的高阶交互模型。本文目标是通过引入一种新颖的高效PSI方法克服此困难。我们的关键思想是利用高阶交互特征间潜在的树结构,并开发一种树的剪枝方法,使我们能快速识别一组未选特征,其保证对PSI无影响。实验结果表明,所提方法使我们能以合理计算代价可靠识别统计显著的高阶交互特征。

关键词

引用

@article{arxiv.1506.07997,
  title  = {An Efficient Post-Selection Inference on High-Order Interaction Models},
  author = {S. Suzumura and K. Nakagawa and K. Tsuda and I. Takeuchi},
  journal= {arXiv preprint arXiv:1506.07997},
  year   = {2015}
}