中文

面向脏类别变量的相似性编码学习

机器学习 2018-06-05 v1 人工智能 机器学习

摘要

在统计学习中,表中的类别变量通常被视为离散实体并分别编码为特征向量,例如采用独热编码(one-hot encoding)。“脏”的未整理数据会产生基数极高但存在冗余的类别变量:多个类别反映同一实体。在数据库中,该问题通常通过去重步骤解决。我们表明,一种将冗余暴露给学习算法的简单方法能带来显著收益。我们研究了一种独热编码的推广——相似性编码(similarity encoding),它基于类别间的相似性构建特征向量。我们在未整理表格上进行了详尽的实证验证,这是机器学习中鲜有研究的问题。在七个真实世界数据集上的结果表明,与已知的类别或字符串编码方法(尤其是独热编码与字符 n 元语法词袋)相比,相似性编码在预测上带来显著提升。我们给出编码脏类别的实用建议:3-gram 相似性似乎是捕捉形态相似性的良好选择。对于极高基数情形,降维以微小性能损失显著降低了计算成本:随机投影或选取原型类别子集仍优于经典编码方法。

关键词

引用

@article{arxiv.1806.00979,
  title  = {Similarity encoding for learning with dirty categorical variables},
  author = {Patricio Cerda and Gaël Varoquaux and Balázs Kégl},
  journal= {arXiv preprint arXiv:1806.00979},
  year   = {2018}
}