中文

跨领域文本到 SQL 模型与基准的评估

计算与语言 2023-10-31 v1 数据库 机器学习

摘要

文本到 SQL(Text-to-SQL)基准在评估该领域的进展以及不同模型的排名方面起着关键作用。然而,由于自然语言查询定义不清、模型生成查询与参考查询中固有的假设,以及某些条件下 SQL 输出的非确定性等原因,在基准中将模型生成的 SQL 查询与参考 SQL 查询准确匹配常常会失败。在本文中,我们对几个著名的跨领域文本到 SQL 基准进行了广泛研究,并通过人工评估 SQL 查询并将其重写为等价表达式,重新评估了这些基准中一些性能最优的模型。我们的评估表明,由于所提供的样本可推导出多种解释,在这些基准上达到完美性能是不可行的。此外,我们发现模型的真实性能被低估,且重新评估后其相对性能发生了变化。最值得注意的是,我们的评估揭示了一个令人惊讶的发现:在我们的人工评估中,一个近期基于 GPT4 的模型在 Spider 基准中超越了黄金标准参考查询。这一发现凸显了谨慎解读基准评估的重要性,同时也承认额外的独立评估在推动该领域进步中的关键作用。

关键词

引用

@article{arxiv.2310.18538,
  title  = {Evaluating Cross-Domain Text-to-SQL Models and Benchmarks},
  author = {Mohammadreza Pourreza and Davood Rafiei},
  journal= {arXiv preprint arXiv:2310.18538},
  year   = {2023}
}

备注

To appear in EMNLP 2023