用于相似搜索的扩散向量
机器学习
2019-09-02 v3 机器学习
摘要
对多维数据分布进行离散化是现代索引方法的基础步骤。最先进的技术在训练数据上学习量化器的参数以获得最优性能,从而使量化器适应数据。在本工作中,我们提出反转这一范式,使数据适应量化器:我们训练一个神经网络,其最后一层构成一个固定的无参数量化器,例如超球面的预定义点。作为代理目标,我们设计并训练了一个神经网络,该网络在保持映射后邻域结构的同时,有利于球状潜空间中的均匀性。我们提出了一种源自 Kozachenko--Leonenko 微分熵估计量的新正则化项以强制均匀性,并将其与局部感知的三元组损失相结合。实验表明,我们的端到端方法优于大多数学习型量化方法,并在广泛采用的基准上与最先进水平具有竞争力。此外,我们表明在没有量化步骤的情况下训练几乎不会造成精度差异,但会产生一个可应用于任何后续量化器的通用催化剂。
引用
@article{arxiv.1806.03198,
title = {Spreading vectors for similarity search},
author = {Alexandre Sablayrolles and Matthijs Douze and Cordelia Schmid and Hervé Jégou},
journal= {arXiv preprint arXiv:1806.03198},
year = {2019}
}
备注
Published at ICLR 2019