BIRD-INTERACT:通过动态交互重新想象文本到 SQL 的评估——面向大语言模型
人工智能
2026-03-25 v3
摘要
大型语言模型(LLM)在单轮文本到 SQL 任务上已显示出卓越的性能,但实际的数据库应用主要需要通过多轮交互来处理模糊查询、执行错误和不断变化的用户需求。现有的多轮基准不足之处在于将对话历史视为静态上下文或限制评估仅限于只读操作,未能反映生产级数据库助手的挑战。我们引入 BIRD-INTERACT 基准,通过以下方式恢复这种现实情境:(1)构建一个综合的交互环境,将每个数据库与层次化知识库、元数据文件和功能驱动的用户模拟器耦合,使模型能够在无需人工监督的情况下 soliciting 澄清请求、检索知识和从错误中恢复;(2)两种评估设置包括预定义的对话协议(c-Interact)和开放式的代理式设置(a-Interact),其中模型自主决定何时查询用户模拟器或探索环境;(3)覆盖业务智能和运营用例的全面 CRUD 任务套件,由可执行测试用例加以保护。每个任务都包含需要动态交互的模糊和后续子任务。该套件包括 BIRD-INTERACT-FULL(600 个任务,最高 11,796 次交互),用于全面性能评估;以及 BIRD-INTERACT-LITE(300 个任务,简化数据库),用于详细的行为分析和快速方法开发。我们的实证结果突显 BIRD-INTERACT 的难度:GPT-5 在 c-Interact 中仅完成 8.67% 的任务,在 a-Interact 中完成 17.00%。通过记忆植入和 Interaction Test-time Scaling 分析,我们验证了有效交互对于复杂动态文本到 SQL 任务的重要性。
引用
@article{arxiv.2510.05318,
title = {BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation for Large Language Models via Lens of Dynamic Interactions},
author = {Nan Huo and Xiaohan Xu and Jinyang Li and Per Jacobsson and Shipei Lin and Bowen Qin and Binyuan Hui and Xiaolong Li and Ge Qu and Shuzheng Si and Linheng Han and Edward Alexander and Xintong Zhu and Rui Qin and Ruihan Yu and Yiyao Jin and Feige Zhou and Weihao Zhong and Yun Chen and Hongyu Liu and Chenhao Ma and Fatma Ozcan and Yannis Papakonstantinou and Reynold Cheng},
journal= {arXiv preprint arXiv:2510.05318},
year = {2026}
}
备注
ICLR 2026 Oral. Dataset and code available at https://bird-interact.github.io