中文

通过对数据与模型系数同时二值化实现内存高效的因子分解机

机器学习 2021-08-18 v1

摘要

因子分解机(FM)是一种通用预测器,可在线性时间内高效建模特征交互,最初为协同推荐提出,并已广泛用于回归、分类和排序任务。子空间编码因子分解机(SEFM)近来被提出,通过对每个输入特征进行独热编码、对个体特征与特征交互均施加显式非线性特征映射,以克服 FM 的表达能力局限。尽管 SEFM 有效,但其将 FM 的内存成本增加 bb 倍,其中 bb 是对每个输入特征应用独热编码时的 bin 数。为降低 SEFM 的内存成本,我们提出一种称为二值化 FM 的新方法,其将模型参数约束为二值(即 1 或 1-1)。随后每个参数值可高效存储于 1 比特。我们提出的方法能显著减少 SEFM 模型的内存成本。此外,我们提出一种新算法,利用直通估计器(STE)与自适应梯度下降(Adagrad)有效且高效地学习带二值约束的所提 FM。最后,我们在八个不同分类数据集上评估所提方法的性能。实验结果表明,所提方法取得了与 SEFM 相当的精度,但内存成本大幅降低。

关键词

引用

@article{arxiv.2108.07421,
  title  = {Memory-Efficient Factorization Machines via Binarizing both Data and Model Coefficients},
  author = {Yu Geng and Liang Lan},
  journal= {arXiv preprint arXiv:2108.07421},
  year   = {2021}
}