中文

ETM:大语言模型时代文本到SQL评估的现代视角

计算与语言 2025-06-18 v4

摘要

文本到SQL任务允许用户使用自然语言从SQL数据库中检索信息。尽管该任务取得了显著进展,但两种主要评估指标——执行准确率(EXE)和完全集合匹配准确率(ESM)都存在固有的局限性,可能误表示性能。具体而言,ESM的刚性匹配忽略了语义上正确但在样式上不同的查询;而EXE可能通过忽略导致正确输出的结构错误而高估正确性。这些局限在评估基于大语言模型(LLM)的方法时尤为突出,因为这些方法在样式和结构上比经过微调的方法更为多变。因此,我们提出了新的指标增强树匹配(ETM),通过同时比较查询的语法和语义元素来缓解这些问题。通过对九个基于LLM的模型进行评估,我们显示EXE和ESM的误报率和误报率分别可高达23.0%和28.9%,而ETM将这些率分别降至0.3%和2.7%。我们将ETM脚本作为开源软件发布,为社区提供一种更稳健可靠的文本到SQL评估方法。

关键词

引用

@article{arxiv.2407.07313,
  title  = {ETM: Modern Insights into Perspective on Text-to-SQL Evaluation in the Age of Large Language Models},
  author = {Benjamin G. Ascoli and Yasoda Sai Ram Kandikonda and Jinho D. Choi},
  journal= {arXiv preprint arXiv:2407.07313},
  year   = {2025}
}