何时可以信任特征选择?-- I:基于条件的 LASSO 分析与广义近似硬度
最优化与控制
2023-12-19 v1 数据结构与算法
机器学习
摘要
人工智能技术进入计算领域,伴随着幻觉和非鲁棒性的潜在风险,使得算法的可信度成为焦点。然而,许多经典方法的可信度尚未被充分理解。特征选择作为科学、统计学、机器学习等领域的一个经典问题便是如此。在此,LASSO 优化问题是标准方法。尽管其被广泛使用,但尚未确定何时可以信任那些试图计算 LASSO 最小化子支撑集以进行特征选择的算法输出。本文确立了这样一个事实:无论精度和计算能力如何,没有任何(随机)算法能在读取近似输入时,以大于 的概率确定所有输入下 LASSO 最小化子的正确支撑集。然而,我们定义了一个 LASSO 条件数,并设计了一种高效算法,只要输入数据是适定的(具有有限条件数),该算法就能在关于维数和条件数对数的多项式时间内计算这些支撑集。对于不适定输入,该算法将永远运行,因此永远不会产生错误答案。此外,当条件数有限时,该算法会计算其上限。最后,对于任何定义在包含无限条件数点的开集上的算法,都存在某个输入使得该算法要么永远运行,要么产生错误答案。我们的不可能性结果源于广义近似硬度——在可解性复杂度指数(SCI)层次框架内——它推广了经典的近似硬度现象。
引用
@article{arxiv.2312.11425,
title = {When can you trust feature selection? -- I: A condition-based analysis of LASSO and generalised hardness of approximation},
author = {Alexander Bastounis and Felipe Cucker and Anders C. Hansen},
journal= {arXiv preprint arXiv:2312.11425},
year = {2023}
}
备注
24 pages, 1 figure