面向表格格式的结构查询与自适应检索引擎SQuARE
计算与语言
2026-04-13 v1
摘要
准确地在真实电子表格上进行问答仍然困难,因为多行标题、合并单元格和单位标注会干扰简单的分块,而僵化的SQL视图在缺乏一致模式的文件上难以工作。我们提出SQuARE,这是一个混合检索框架,具备sheet级别的、复杂度感知的路由功能。它计算基于标题深度和合并密度的连续评分,然后将查询路由到通过结构保留分块检索或SQL(基于自动构建的关系表示)进行检索。轻量级智能体监督检索、细化或组合两种路径的结果,以应对置信度不高的情况。该设计保持标题层次结构、时间标签和单位,确保返回的值忠实于原始单元格且易于验证。在多表头企业资产负债表、高度合并的世界银行工作簿以及多样化公共数据集上进行评估,SQuARE在检索精度和端到端答案准确性方面持续超过单一策略基线和ChatGPT-4o,同时保持延迟可预测。通过将检索与模型选择解耦,该系统与新兴表格基础模型兼容,为通向更稳健表格理解提供了实用桥梁。
引用
@article{arxiv.2512.04292,
title = {SQuARE: Structured Query & Adaptive Retrieval Engine For Tabular Formats},
author = {Chinmay Gondhalekar and Urjitkumar Patel and Fang-Chun Yeh},
journal= {arXiv preprint arXiv:2512.04292},
year = {2026}
}
备注
Accepted in The IEEE International Workshop on Large Language Models in Finance, Dec 8-11, Macau, China, 2025, Preprint Copy