中文

基于层次聚类的树状文本检索方法在 RAG 框架中的应用:以台湾法规为例

组合数学 2025-06-17 v1 计算几何

摘要

传统检索增强生成 (RAG) 系统采用暴力内积搜索检索最相似的 top-k 个文档,然后与用户查询一起传递给语言模型。这允许模型访问外部知识并减少幻觉。然而,在实际应用中选择合适的 k 值仍是一个重要挑战:k 值太小可能检索不到足够的信息,而 k 值过大则会引入过多无关内容。为此,我们提出了一种基于层次聚类的检索方法,无需预定义 k 值。我们的 approach 保持系统响应的准确性和相关性,同时自适应地选择语义上相关的内容。在实验阶段,我们将该方法应用于台湾法律数据集上的 expert-graded 查询。结果表明,我们的方法在 expert 评估中取得优异性能,同时保持高精度,无需预定义 k 值,显示在法律文本检索任务中具有 improved 的准确性和可解释性。该 framework 简单易实现,且轻松集成到现有的 RAG 流程中,成为在资源有限的条件下实际应用的实用解决方案。

关键词

引用

@article{arxiv.2506.13606,
  title  = {Largest dyadic dual VC-dimension of non-piercing families},
  author = {Xinqi Huang and Yuzhen Qi and Mingyuan Rong and Zixiang Xu},
  journal= {arXiv preprint arXiv:2506.13606},
  year   = {2025}
}

备注

5 pages, 2 figures