中文

Text2SQL 解决方案评估的根本挑战及其局限性检测

机器学习 2025-02-05 v1 数据库

摘要

本工作深入探讨了Text2SQL解决方案的根本评估挑战,概述潜在的失败原因和依赖于现有基准测试中聚合指标的潜在风险。我们识别出当前开放基准测试中 largely 未被充分解决的两个局限性:(1)评估数据中的数据质量问题,主要归因于未捕获自然语言描述转化为结构化查询的概率本质(例如,语言歧义);(2)使用不同匹配函数作为SQL等价性近似值引入的偏差。为了将这些局限性置于背景之下,我们提出了Text2SQL局限性的统一分类法,可导致预测和评估错误。我们随后通过对Text2SQL局限性的调查来论证该分类法,采用最先进的Text2SQL解决方案和基准测试。我们描述了局限性的成因,提供了真实世界的例子,并为分类法中的每个类别提出了潜在的缓解措施。我们总结了在部署这些缓解策略或尝试自动应用该分类法时遇到的开放性挑战。

关键词

引用

@article{arxiv.2501.18197,
  title  = {Fundamental Challenges in Evaluating Text2SQL Solutions and Detecting Their Limitations},
  author = {Cedric Renggli and Ihab F. Ilyas and Theodoros Rekatsinas},
  journal= {arXiv preprint arXiv:2501.18197},
  year   = {2025}
}