基于RAG框架中层次聚类的树状文本检索:在台湾法规中的应用
信息检索
2025-06-17 v1
摘要
传统的检索增强生成(RAG)系统采用暴力内积搜索来检索最相似的top-k文档,然后与用户查询结合并传递给语言模型。这允许模型访问外部知识并减少幻觉。然而,在实际应用中,选择合适的k值仍然是一个重大挑战:较小的k可能无法检索到足够的信息,而较大的k可能引入过多不相关的内容。为了解决这个问题,我们提出了一种基于层次聚类的检索方法,无需预定义k。我们的方法在自适应选择语义相关内容的同时,保持了系统响应的准确性和相关性。在实验阶段,我们将我们的方法应用于带有专家评分查询的台湾法律数据集。结果表明,我们的方法在专家评估中取得了优越的性能,并在无需预定义k的情况下保持了高精度,展示了在法律文本检索任务中提高的准确性和可解释性。我们的框架实现简单,易于与现有的RAG流程集成,使其成为资源有限的实际应用中的实用解决方案。
引用
@article{arxiv.2506.13607,
title = {Tree-Based Text Retrieval via Hierarchical Clustering in RAGFrameworks: Application on Taiwanese Regulations},
author = {Chia-Heng Yu and Yen-Lung Tsai},
journal= {arXiv preprint arXiv:2506.13607},
year = {2025}
}
备注
19 pages, 5 figures, Code available at https://github.com/arthur422tp/hierachical