中文

面向多字段类别数据的字段级学习

机器学习 2020-12-02 v1

摘要

我们提出了一种用于多字段类别数据学习的新方法。多字段类别数据通常收集于许多异质子群之上。这些子群可反映在一个字段下的各个类别中。现有方法试图学习一个拟合所有数据的通用模型,这具有挑战性且不可避免地导致学习出一个复杂模型。相反,我们提出一种字段级学习方法,利用数据的自然结构,在适当约束下学习简单而高效的一对一字段聚焦模型。如此,模型可拟合每个类别,从而更好地捕捉数据中潜在差异。我们提出了一种利用带方差与低秩约束的线性模型的模型,以帮助其更好地泛化并减少参数量。该模型在字段级上也是可解释的。由于多字段类别数据的维度可能极高,应用于此类数据的模型大多过度参数化。我们的理论分析潜在地解释了过度参数化对我们模型泛化的影响,也支持了学习目标中的方差约束。在两个大规模数据集上的实验结果展示了我们模型的优越性能、泛化误差界的趋势以及学习结果的可解释性。我们的代码可在 https://github.com/lzb5600/Field-wise-Learning 获取。

关键词

引用

@article{arxiv.2012.00202,
  title  = {Field-wise Learning for Multi-field Categorical Data},
  author = {Zhibin Li and Jian Zhang and Yongshun Gong and Yazhou Yao and Qiang Wu},
  journal= {arXiv preprint arXiv:2012.00202},
  year   = {2020}
}

备注

Accepted at NeurIPS 2020