中文

GenEdit:复合算子与持续改进以应对企业级 Text-to-SQL

人工智能 2025-03-28 v1

摘要

由大语言模型驱动的 Text-to-SQL 的最新进展正在使数据访问大众化。尽管取得了这些进展,但由于需要捕获特定业务知识、处理复杂查询以及满足持续改进的期望,企业级部署仍然具有挑战性。为了解决这些问题,我们设计并实现了 GenEdit:我们的 Text-to-SQL 生成系统,该系统可通过用户反馈进行改进。GenEdit 构建并维护特定于公司的知识集,采用算子流水线分解 SQL 生成过程,并利用反馈更新其知识集以改进未来的 SQL 生成。我们描述了由两个核心模块组成的 GenEdit 架构: 分解的 SQL 生成; 基于用户反馈的知识集编辑。在生成方面,GenEdit 利用复合算子来改进知识检索,并创建一个作为思维链步骤的计划来指导生成。GenEdit 首先在初始检索阶段检索相关示例,其中原始 SQL 查询被分解为子语句、子句或子查询。然后它还检索指令和模式元素。利用检索到的上下文信息,GenEdit 随后以自然语言逐步生成关于如何产生查询的计划。最后,GenEdit 使用该计划生成 SQL,最大限度地减少对模型推理的需求,从而增强了复杂 SQL 的生成。如有必要,GenEdit 会根据语法和语义错误重新生成查询。知识集编辑通过交互式副驾驶推荐,允许用户迭代其反馈并根据需要重新生成 SQL 查询。每次生成都使用分阶段编辑来更新生成提示。一旦反馈被提交,它将在通过回归测试并获得批准后被合并,从而改进未来的生成。

关键词

引用

@article{arxiv.2503.21602,
  title  = {GenEdit: Compounding Operators and Continuous Improvement to Tackle Text-to-SQL in the Enterprise},
  author = {Karime Maamari and Connor Landy and Amine Mhedhbi},
  journal= {arXiv preprint arXiv:2503.21602},
  year   = {2025}
}