中文

Binarity:线性监督学习中独热编码特征的惩罚方法

机器学习 2019-01-10 v4

摘要

本文处理在大量连续特征可用的情况下的大规模线性监督学习问题。我们提议将众所周知的连续特征独热编码技巧与一种称为“binarity”的新惩罚方法相结合。在源自单个原始连续特征独热编码的每组二元特征中,该惩罚使用总变差正则化以及一个额外的线性约束。这在独热编码特征的模型权重上诱导出两个有趣的性质:它们是分段常数,并且最终是块稀疏的。针对广义线性模型提出了非渐近 oracle 不等式。此外,在稀疏加性模型假设下,我们证明了我们的过程在该设置中匹配了最先进水平。数值实验说明了我们的方法在多个数据集上的良好性能。同样值得注意的是,我们的方法具有与标准 1\ell_1 惩罚相当的计算复杂度。

关键词

引用

@article{arxiv.1703.08619,
  title  = {Binarsity: a penalization for one-hot encoded features in linear supervised learning},
  author = {Mokhtar Z. Alaya and Simon Bussy and Stéphane Gaïffas and Agathe Guilloux},
  journal= {arXiv preprint arXiv:1703.08619},
  year   = {2019}
}