中文

RAG-Text2SQL 系统中的内容大小平衡

信息检索 2025-03-25 v3 人工智能 数据库

摘要

大型语言模型(Large Language Models, LLMs)作为将自然语言查询转换为 SQL 命令的有前景的解决方案,使数据库交互变得无缝。然而,这些文本到 SQL(Text2SQL)系统面临固有的局限性,包括幻觉、过时知识和不可追溯的推理过程。为了应对这些挑战,检索增强生成(RAG)与 Text2SQL 模型的集成正受到关注。RAG 作为检索机制,提供关键的上下文信息,如表模式和元数据,以增强查询生成过程。尽管具有潜力,但 RAG + Text2SQL 系统容易受到检索文档的质量和大小的影响。虽然更丰富的文档内容可以提高模式相关性和检索准确性,但也会引入噪声,随着 Text2SQL 模型提示词大小的增加,增加幻觉风险并降低查询保真度。这项研究探索了文档大小与质量之间的细微权衡,旨在找到平衡点以优化系统性能。我们识别了性能下降的关键阈值,并提出了可操作的策略来缓解这些挑战。此外,我们还探讨了 Text2SQL 模型中的幻觉现象,强调精选文档呈现在最小化错误方面的关键作用。我们的发现为增强 RAG + Text2SQL 系统的鲁棒性提供了路线图,为实际应用提供了实用见解。

关键词

引用

@article{arxiv.2502.15723,
  title  = {Balancing Content Size in RAG-Text2SQL System},
  author = {Prakhar Gurawa and Anjali Dharmik},
  journal= {arXiv preprint arXiv:2502.15723},
  year   = {2025}
}