xyz算法:高效搜索高维数据中的交互项
机器学习
2018-09-19 v4 统计计算
摘要
当对具有个变量的数据集进行回归时,通常有必要超越使用主要线性效应,并将交互项视为各变量之间的乘积。对于小规模问题,这些交互项可以显式计算,但若朴素地执行则会导致至少的计算复杂度。当非常大时,这一代价可能难以承受。我们提出了一种新的随机化算法,能够以高概率发现交互项,并且在温和条件下其运行时间是的次二次。我们证明强交互项可以在近乎线性时间内发现,而寻找较弱交互项则需要次操作,其中取决于其强度。其基本思想是将交互项搜索转化为最近点对问题,该问题可以在次二次时间内高效求解。该算法被称为,并用R语言实现。我们展示了其在全基因组关联研究中的应用效率,在单核1.2 GHz CPU上可在280秒内筛选超过个交互项。
引用
@article{arxiv.1610.05108,
title = {The xyz algorithm for fast interaction search in high-dimensional data},
author = {Gian-Andrea Thanei and Nicolai Meinshausen and Rajen D. Shah},
journal= {arXiv preprint arXiv:1610.05108},
year = {2018}
}