ResBit:用于类别值的残差比特向量
机器学习
2024-11-15 v4
摘要
独热向量(one-hot vectors)是机器学习中表示离散/类别数据的常用方法,因其简单直观而被广泛使用。然而,独热向量存在维度线性增长的问题,带来了计算和内存挑战,尤其是在处理包含众多类别的数据集时。本文关注表格数据生成,并揭示多项扩散(multinomial diffusion)在基数较高时会面临模式崩溃现象。此外,由于独热向量的局限性,在此情况下的训练阶段耗时更长。为解决这些问题,我们提出残差比特向量(ResBit),一种用于稠密表示类别数据的技术。ResBit是模拟比特(analog bits)的扩展,克服了模拟比特应用于表格数据生成时的局限性。我们的实验表明,与未应用ResBit的情况相比,ResBit不仅加速了训练,还保持了性能。此外,我们的结果表明许多现有方法难以处理高基数数据,凸显了对ResBit和潜向量等低维表示的需求。
引用
@article{arxiv.2309.17196,
title = {ResBit: Residual Bit Vector for Categorical Values},
author = {Masane Fuchi and Amar Zanashir and Hiroto Minami and Tomohiro Takagi},
journal= {arXiv preprint arXiv:2309.17196},
year = {2024}
}
备注
25 pages, 29 tables, and 10 figures