中文

vstash:面向大语言模型智能体的自适应融合本地优先混合检索

信息检索 2026-04-20 v1

摘要

我们提出了 vstash,一个本地优先的文档记忆系统,它通过倒数秩融合(RRF)和自适应逐查询 IDF 加权,结合了向量相似性搜索与全文关键词匹配。所有数据都驻留在一个单一的 SQLite 文件中,使用 sqlite-vec 进行近似最近邻搜索,并使用 FTS5 进行关键词匹配。我们做出了四项主要贡献。(1)通过混合检索分歧进行自监督嵌入精炼:在 SciFact、NFCorpus 和 FiQA 上的 753 个 BEIR 查询中,74.5% 的查询在向量为主(vec=0.95, fts=0.05)和 FTS 为主(vec=0.05, fts=0.95)的搜索之间产生了 top-10 分歧(各数据集比率分别为 63.4% / 73.4% / 86.7%,第 5.2 节),这提供了一个无需人工标签的免费训练信号。使用 MultipleNegativesRankingLoss 在 76K 个分歧三元组上微调 BGE-small(33M 参数),在所有 5 个 BEIR 数据集上提高了 NDCG@10(与 BGE-small 基础 RRF 相比,在 NFCorpus 上最高提升 +19.5%,表 6)。在 5 个数据集中的 3 个上,在不同预处理下,微调后的 33M 参数流程匹配或超过了已发布的 ColBERTv2 结果(110M 参数)和未训练的 BGE-base(110M);在 FiQA 和 ArguAna 上,其性能低于 ColBERTv2(第 5.5 节)。(2)与固定权重相比,具有自适应查询 IDF 加权的自适应 RRF 在所有 5 个 BEIR 数据集上提高了 NDCG@10(在 ArguAna 上最高达 +21.4%),使用 BGE-small 在 SciFact 上达到 0.7263。(3)关于 RRF 后评分的负面结果:频率+衰减、历史增强召回和交叉编码器重排序均未能提高 NDCG。(4)一个生产级基础,具有完整性检查、模式版本控制、排序诊断以及一个在 5 个 BEIR 数据集的 50,425 个相关性判断查询上验证过的基于距离的相关性信号。在 50K 块时,搜索延迟中位数保持在 20.9 毫秒,且 NDCG 稳定。微调后的模型以 `Stffens/bge-small-rrf-v2` 之名发布在 HuggingFace 上。所有代码、数据和实验均为开源。

关键词

引用

@article{arxiv.2604.15484,
  title  = {vstash: Local-First Hybrid Retrieval with Adaptive Fusion for LLM Agents},
  author = {Jayson Steffens},
  journal= {arXiv preprint arXiv:2604.15484},
  year   = {2026}
}