动态数据集上的近似最近邻搜索:一项调查研究
机器学习
2025-02-04 v5
摘要
近似k近邻方法常用于挖掘信息并辅助大规模高维数据集上的机器学习。ANN方法通常在用于加速搜索的索引结构上有所不同,从而产生各种召回率/运行时间权衡点。对于静态数据集的应用,运行时约束和数据集属性可用于凭经验选择具有合适操作特性的ANN方法。然而,对于动态数据集的应用,这些数据集经常受到在线变化(如添加新样本)的影响,目前对于哪种ANN方法最合适尚未达成共识。传统的评估方法不考虑更新索引结构的计算成本,以及索引更新的速率和大小。为了解决这个问题,我们在两个主要应用(在线数据收集和在线特征学习)上,同时考虑这些因素,对5种流行的ANN方法进行了实证评估。使用了两个动态数据集,分别来自包含100万个样本的SIFT1M数据集和包含10亿个样本的DEEP1B数据集。结果表明,常用的k-d树方法不适用于动态数据集,因为它比直接的基线穷举搜索方法更慢。对于在线数据收集,分层可导航小世界图方法在广泛的召回率范围内实现了相对于基线的持续加速。对于在线特征学习,可扩展最近邻方法在召回率低于75%时比基线更快。
引用
@article{arxiv.2404.19284,
title = {Approximate Nearest Neighbour Search on Dynamic Datasets: An Investigation},
author = {Ben Harwood and Amir Dezfouli and Iadine Chades and Conrad Sanderson},
journal= {arXiv preprint arXiv:2404.19284},
year = {2025}
}