中文

文本到 SQL 基准和排行榜被注释错误破坏

人工智能 2026-01-21 v3 数据库

摘要

研究人员提出了许多文本到 SQL 技术,以简化数据分析并加速数据驱动应用程序的开发。为了比较这些技术并为部署选择最佳方案,社区依赖公共基准及其排行榜。由于这些基准在问题构建和答案评估过程中高度依赖人类注释,注释的有效性至关重要。本文进行了一项实证研究:(i) 对两种广泛使用的文本到 SQL 基准 BIRD 和 Spider 2.0-Snow 的注释错误率进行基准测试,(ii) 更正 BIRD 开发(Dev) 子集的一部分以衡量注释错误对文本到 SQL 代理性能和排行榜排名的影响。通过专家分析,我们显示 BIRD Mini-Dev 和 Spider 2.0-Snow 的错误率分别为 52.8% 和 62.8%。我们对 BIRD 排行榜上的全部 16 个开源代理在原始和已校正的 BIRD Dev 子集上进行重新评估。我们表明性能变化范围为 -7% 到 31%(相对术语),排名变化范围为 9-9+9+9 位。我们进一步评估这些影响是否推广到完整的 BIRD Dev 子集。我们发现,未经校正子集上的代理排名与完整 Dev 子集上的排名高度相关(Spearman's rsr_s=0.85, pp=3.26e-5),而与已校正子集上的排名相关性很弱(Spearman's rsr_s=0.32, pp=0.23)。这些发现表明,注释错误会显著扭曲报告的性能和排名,可能误导研究方向或部署选择。我们的代码和数据可在 https://github.com/uiuc-kang-lab/text_to_sql_benchmarks 提供。

关键词

引用

@article{arxiv.2601.08778,
  title  = {Pervasive Annotation Errors Break Text-to-SQL Benchmarks and Leaderboards},
  author = {Tengjun Jin and Yoojin Choi and Yuxuan Zhu and Daniel Kang},
  journal= {arXiv preprint arXiv:2601.08778},
  year   = {2026}
}

备注

18 pages, 14 figures, 9 tables