Text-to-Python与Text-to-SQL基准对比:显式逻辑与歧义性的影响
人工智能
2026-01-26 v2 软件工程
摘要
尽管Text-to-SQL仍是数据库交互的主流方法,但现实世界的分析越来越需要Python或Pandas等通用编程语言的灵活性,以管理基于文件的数据和复杂的分析工作流。尽管这一需求日益增长,但与成熟的SQL生态系统相比,Text-to-Python在核心数据检索方面的可靠性仍未得到充分探索。为填补这一空白,我们引入了BIRD-Python,一个专为跨范式评估设计的基准。我们系统性地优化了原始数据集,以减少标注噪声并对齐执行语义,从而为比较建立了一致且标准化的基线。我们的分析揭示了一种根本性的范式差异:SQL通过其声明式结构利用隐式的DBMS行为,而Python则需要显式的过程式逻辑,使其对未明确的用户意图高度敏感。为缓解这一挑战,我们提出了逻辑补全框架,该框架通过将潜在的领域知识融入生成过程来解决歧义。实验结果表明:(1) 性能差异主要源于缺失的领域上下文,而非代码生成的内在局限;(2) 当这些差距被弥补时,Text-to-Python的性能可与Text-to-SQL持平。这些发现确立了Python作为分析智能体的可行基础——前提是系统能够有效地将模糊的自然语言输入锚定在可执行的逻辑规范上。相关资源可在https://anonymous.4open.science/r/Bird-Python-43B7/获取。
引用
@article{arxiv.2601.15728,
title = {Benchmarking Text-to-Python against Text-to-SQL: The Impact of Explicit Logic and Ambiguity},
author = {Hangle Hu and Chenyu Hou and Bin Cao and Ruizhe Li},
journal= {arXiv preprint arXiv:2601.15728},
year = {2026}
}
备注
8 pages, 7 figures