SPELUNKER:使用大型语言模型和自定义 K 近邻的数值相似性搜索
信息检索
2025-09-29 v1
摘要
本文提出了一种混合系统,用于直观的数值相似性搜索,将大型语言模型(LLM)与自定义 K 近邻(KNN)算法相结合。与黑箱稠密向量系统不同,此体系结构通过首先使用 LLM 将自然语言查询转换为结构化、基于属性的搜索,从而提供了卓越的可解释性。该结构化查询随后作为输入提供给采用 BallTree 搜索策略的自定义 KNN 算法,后者使用异构距离度量以保留数据类型。我们的评估在 500 条酒品评论的数据集上进行,表明该系统有效。LLM 在信息抽取方面 achieved F1 分数为 0.9779,同时也表现出高保真度,Jaro 字符串相似度为 0.9321。当我们将 LLM 基于的重新排序augmented KNN 算法时,观察到召回率有显著提高(p=0.013),表明 LLM 能够识别并提升与细腻用户意图相符的相关项目。这种方法有效地弥合了人类语言与机器可理解的数值表示之间的差距,提供了透明且细致的搜索能力。
引用
@article{arxiv.2509.21323,
title = {SPELUNKER: Item Similarity Search Using Large Language Models and Custom K-Nearest Neighbors},
author = {Ana Rodrigues and João Mata and Rui Rego},
journal= {arXiv preprint arXiv:2509.21323},
year = {2025}
}
备注
6 pages, 4 figures