通过定向模式搜索学习高阶交互
机器学习
2024-05-15 v1
摘要
逻辑回归(LR)是实证二分类研究中广泛使用的统计方法。然而,现实场景通常具有阻碍直接使用 LR 模型的复杂性,反而凸显了需要包含高阶交互以捕捉数据变异性。这变得更具挑战性是因为:(i) 数据集变宽,变量越来越多;(ii) 研究通常在强不平衡设置下进行;(iii) 样本从非常大到极小;(iv) 需要提供预测模型和可解释结果。在本文中,我们提出一种新颖算法,即通过定向模式搜索学习高阶交互(LIPS),用于在输入数据为类别型时,为不平衡二分类任务选择不同阶数的交互项以纳入 LR 模型。LIPS 的原理源于项集与类别型交互之间的对偶性。该算法依赖于基于知名频繁项集挖掘算法的交互学习步骤,以及一种新颖的基于相异度的交互选择步骤,允许用户指定纳入 LR 模型的交互数量。此外,我们特化了两个变体(Scores LIPS 和 Clusters LIPS),可满足更特定的需求。通过一组实验,我们验证了我们的算法并证明了其对现实研究场景的广泛适用性,表明其优于基准的先进算法。
引用
@article{arxiv.2102.12974,
title = {Learning High-Order Interactions via Targeted Pattern Search},
author = {Michela C. Massi and Nicola R. Franco and Francesca Ieva and Andrea Manzoni and Anna Maria Paganoni and Paolo Zunino},
journal= {arXiv preprint arXiv:2102.12974},
year = {2024}
}