中文

用于评估未见且无标签数据的Text2SQL模型的高效且有效的评估器

计算与语言 2026-03-10 v1

摘要

近期大型语言模型的进展加强了将自然语言问题翻译为数据库查询的Text2SQL系统。一个持续存在的部署挑战是:在没有验证答案可用的情况下,对新训练的Text2SQL系统进行评估。这一情况经常发生,因为数据库内容和结构不断变化,隐私政策减慢了手动审查, carefully编写的SQL标签成本高昂且耗时。没有及时的评估,组织无法批准发布或提前检测故障。FusionSQL通过与任何Text2SQL模型配合工作,在没有参考标签的情况下估计准确性,允许团队在未见且无标签的数据集上衡量质量。它分析系统自身输出中的模式,以刻画目标数据集与训练期间所用材料之间的差异。FusionSQL支持预发布检查、持续监控新数据库以及检测质量下降。跨越多样化应用场景和问题类型的实验表明,FusionSQL在实际准确性方面具有很好的跟随性,并且可靠地信号化问题的出现。我们的代码已在 https://github.com/phkhanhtrinh23/FusionSQL 上提供。

关键词

引用

@article{arxiv.2603.07841,
  title  = {An Efficient and Effective Evaluator for Text2SQL Models on Unseen and Unlabeled Data},
  author = {Trinh Pham and Thanh Tam Nguyen and Viet Huynh and Hongzhi Yin and Quoc Viet Hung Nguyen},
  journal= {arXiv preprint arXiv:2603.07841},
  year   = {2026}
}

备注

Accepted at ICDE 2026