高维索引作为文件结构的奇案:eCP-FS 的案例研究
信息检索
2025-07-30 v1
摘要
现代分析管道常常部署多个深度学习和检索模型,这些模型依赖近似最近邻(ANN)索引来支持高效的基于相似性的搜索。虽然许多最先进的 ANN 索引是内存中的(如 HNSW 和 IVF),但使用多个 ANN 索引会在有限的 GPU/CPU 内存资源之间造成竞争,这反过来又 necessitates 磁盘基索引(如 DiskANN 或 eCP)。在典型的索引实现中,主要组件是一个复杂的数据结构,序列化到磁盘,并在启动时完全读取(针对内存基索引),或在查询时逐步读取(针对磁盘基索引)。为了可视化索引结构或分析其质量,需要复杂的编码,这些编码要么嵌入索引实现中,要么复制读取数据结构的代码。在本文中,我们考虑一种替代方法,将数据结构映射到文件结构上,使用文件库使索引对任何编程语言甚至人类可读。劣势是序列化后的索引冗余,导致通过索引的搜索开销。在此基础上,本文提出 eCP-FS,这是 eCP 的一种基于文件的文件实现。与最先进的索引进行比较显示,虽然 eCP-FS 较慢,但即使在内存受限的情况下,其实现仍具有一定竞争力。在内存受限的情况下,eCP-FS 提供最小的内存占用,使其适用于资源受限或多索引环境。
引用
@article{arxiv.2507.21939,
title = {The Curious Case of High-Dimensional Indexing as a File Structure: A Case Study of eCP-FS},
author = {Omar Shahbaz Khan and Gylfi Þór Guðmundsson and Björn Þór Jónsson},
journal= {arXiv preprint arXiv:2507.21939},
year = {2025}
}