CORE-T:面向 Text-to-SQL 的表连贯检索
计算与语言
2026-05-29 v2 人工智能
信息检索
摘要
现实的 Text-to-SQL 工作流通常需要连接多个表。因此,准确检索相关表集合成为端到端性能的关键瓶颈。我们研究了一种开放书设定,即必须在汇集自多个来源的大型异构表集合上回答查询,且没有干净的界定信号(如数据库标识符)。在此设定下,密集检索 (DR) 实现了高召回率,但返回许多干扰项;而连接感知的替代方案通常依赖额外假设且/或产生高推理开销。我们提出 CORE-T,一个可扩展且无需训练的框架,利用 LLM 生成的用途元数据丰富表信息,并预计算轻量级的表兼容性缓存。在推理时,DR 返回 top-K 候选;单次 LLM 调用选取一个连贯且可连接的子集,两步加性调整阶段恢复强兼容的表。在 Bird、Spider、MMQA 和 Beaver 上,CORE-T 在表选择 F1 上较 DR 提升高达 22.7 个百分点,同时返回的表数量减少高达 40%;在多表执行准确率上提升高达 24.4 个百分点,且使用的总选择 token 数比 LLM 密集型基线少 1.64-4.20 倍。
关键词
引用
@article{arxiv.2601.13111,
title = {CORE-T: COherent REtrieval of Tables for Text-to-SQL},
author = {Hassan Soliman and Vivek Gupta and Dan Roth and Iryna Gurevych},
journal= {arXiv preprint arXiv:2601.13111},
year = {2026}
}
备注
Preprint is revised and under review. Code and data available at: https://github.com/UKPLab/arxiv2026-core-t