Min-Max 核
机器学习
2015-03-06 v1 机器学习
统计计算
摘要
Min-Max 核是流行 resemblance 核(专为二元数据设计)的推广。本文通过广泛的核机器分类研究,证明 Min-Max 核通常能为非负数据提供有效的相似性度量。由于 Min-Max 核是非线性的,在处理大规模数据的工业应用中可能难以使用,我们展示了 Min-Max 核可以通过哈希技术线性化。这使得从业者能够利用成熟的线性算法(如线性 SVM 或逻辑回归)在大规模应用中应用 Min-Max 核。先前的加权一致采样(CWS)工作产生的样本形式为 ,其中 记录了位置(实际上也记录了权重)信息,类似于经典 minwise 哈希在二元数据上产生的样本。由于 在理论上是无界的,因此如何有效实现 CWS 以构建大规模线性分类器并不明确。本文通过丢弃 (我们称之为"0-bit"方案)提供了一个简单的解决方案。通过广泛的实证研究,我们证明该 0-bit 方案不会丢失本质信息。随后,我们将"0-bit"CWS 应用于构建线性分类器以近似 Min-Max 核分类器,并在广泛使用的公开分类数据集上进行了大量验证。我们期望这项工作将引起数据挖掘从业者对高效利用非二元和非负数据非线性信息的兴趣。
引用
@article{arxiv.1503.01737,
title = {Min-Max Kernels},
author = {Ping Li},
journal= {arXiv preprint arXiv:1503.01737},
year = {2015}
}