中文

Lasso 的多重等价解

统计理论 2018-02-27 v2 统计理论

摘要

特征选择是数据分析中研究的一个重要问题,旨在寻找一个最小规模的特征子集,以对感兴趣的结果实现最优预测。它也是知识发现中获取领域洞察的有力工具,例如识别哪些医学指标携带了关于疾病状态的独特信息。然而,较少被认识到的是,该问题可能存在多个等价解。在这种情况下,仅向领域专家报告其中一个解而忽略所有其他等价解是具有误导性的。本文将一种成熟的单特征选择算法(即报告单一解的 Lasso 算法)扩展到多解问题,并基于分类和回归任务中等价性的形式化概念。实证结果是通过一个名为 Just Add Data Bio 或 JAD Bio 的全自动化流水线获得的,该流水线训练并选择多个线性和非线性学习器,优化超参数值,并纠正多次归纳(模型选择)的偏差。结果表明,在真实数据集中确实存在多个解,并且该算法能够识别其中的一个子集。与 Statistical Equivalent Solutions (SES) 算法的比较表明,Lasso 等价解具有更好的预测性能,但代价是选择了更多的特征。

关键词

引用

@article{arxiv.1710.04995,
  title  = {Multiple Equivalent Solutions for the Lasso},
  author = {Yannis Pantazis and Vincenzo Lagani and Paulos Charonyktakis and Ioannis Tsamardinos},
  journal= {arXiv preprint arXiv:1710.04995},
  year   = {2018}
}

备注

10 pages, 2 figures, 3 tables