中文

用于相似搜索的扩散向量

机器学习 2019-09-02 v3 机器学习

摘要

对多维数据分布进行离散化是现代索引方法的基础步骤。最先进的技术在训练数据上学习量化器的参数以获得最优性能,从而使量化器适应数据。在本工作中,我们提出反转这一范式,使数据适应量化器:我们训练一个神经网络,其最后一层构成一个固定的无参数量化器,例如超球面的预定义点。作为代理目标,我们设计并训练了一个神经网络,该网络在保持映射后邻域结构的同时,有利于球状潜空间中的均匀性。我们提出了一种源自 Kozachenko--Leonenko 微分熵估计量的新正则化项以强制均匀性,并将其与局部感知的三元组损失相结合。实验表明,我们的端到端方法优于大多数学习型量化方法,并在广泛采用的基准上与最先进水平具有竞争力。此外,我们表明在没有量化步骤的情况下训练几乎不会造成精度差异,但会产生一个可应用于任何后续量化器的通用催化剂。

关键词

引用

@article{arxiv.1806.03198,
  title  = {Spreading vectors for similarity search},
  author = {Alexandre Sablayrolles and Matthijs Douze and Cordelia Schmid and Hervé Jégou},
  journal= {arXiv preprint arXiv:1806.03198},
  year   = {2019}
}

备注

Published at ICLR 2019