一种用于可扩展交互检测的自惩罚目标函数
统计方法学
2020-12-15 v2 机器学习
统计理论
统计理论
摘要
我们解决非参数变量选择问题,重点在于发现变量间的交互。对于 p 个变量,存在 O(p^s) 种可能的 s 阶交互,使得穷举搜索不可行。然而,仅以线性计算代价 O(p) 识别参与交互的变量是可能的。诀窍在于最大化一类参数化的非参数依赖度量,我们称之为度量学习目标函数;这些非凸目标函数的地形对交互敏感,但目标函数本身并不显式建模交互。三个性质使度量学习目标函数极具吸引力:(a)目标的驻点自动稀疏(即执行选择)——无需显式 ℓ_1 惩罚。(b)目标的所有驻点以高概率排除噪声变量。(c)保证恢复所有信号变量,而无需达到目标的全局极大值或特殊驻点。第二和第三个性质意味着我们所有的理论结果都适用于使用梯度上升来最大化度量学习目标函数的实际情况。虽然并非所有度量学习目标函数都具有良好的统计功效,我们设计了一个基于 ℓ_1 核的目标函数,其确实展现出有利的功效:它恢复(i)主效应需 n ∼ log p 样本,(ii)层次交互需 n ∼ log p 样本,以及(iii)s 阶纯交互需 n ∼ p^{2(s-1)} log p 样本。
引用
@article{arxiv.2011.12215,
title = {A Self-Penalizing Objective Function for Scalable Interaction Detection},
author = {Keli Liu and Feng Ruan},
journal= {arXiv preprint arXiv:2011.12215},
year = {2020}
}
备注
34 pages; the Appendix can be found on the authors' personal websites (the url is in the pdf)