Binarity:线性监督学习中独热编码特征的惩罚方法
机器学习
2019-01-10 v4
摘要
本文处理在大量连续特征可用的情况下的大规模线性监督学习问题。我们提议将众所周知的连续特征独热编码技巧与一种称为“binarity”的新惩罚方法相结合。在源自单个原始连续特征独热编码的每组二元特征中,该惩罚使用总变差正则化以及一个额外的线性约束。这在独热编码特征的模型权重上诱导出两个有趣的性质:它们是分段常数,并且最终是块稀疏的。针对广义线性模型提出了非渐近 oracle 不等式。此外,在稀疏加性模型假设下,我们证明了我们的过程在该设置中匹配了最先进水平。数值实验说明了我们的方法在多个数据集上的良好性能。同样值得注意的是,我们的方法具有与标准 惩罚相当的计算复杂度。
引用
@article{arxiv.1703.08619,
title = {Binarsity: a penalization for one-hot encoded features in linear supervised learning},
author = {Mokhtar Z. Alaya and Simon Bussy and Stéphane Gaïffas and Agathe Guilloux},
journal= {arXiv preprint arXiv:1703.08619},
year = {2019}
}