中文

IndicDB——印度语言多语言文本到SQL基准测试

计算与语言 2026-04-16 v1 人工智能 数据库

摘要

尽管大型语言模型(LLM)已显著推进文本到SQL性能,但现有基准主要聚焦于西方语境和简化模式,留下了面向真实世界、非西方应用的空白。我们提出IndicDB,一个面向印度语言多语言文本到SQL基准,用于评估跨语言语义解析。关系模式来源于开放数据平台,包括国家数据与分析平台(NDAP)和印度数据门户(IDP),确保真实的行政数据复杂性。IndicDB包含20个数据库、237个表格。为将标准化的政府数据转换为丰富的关系结构,我们采用迭代的三代理解框架(Architect、Auditor、Refiner),确保结构严谨和高关系密度(每个数据库平均11.85个表格;联接深度可达6)。我们的管道具备价值感知、难度校准和联接强制特性,生成跨越英文、印地语及五种印度语言的15,617个任务。我们评估了主流模型(DeepSeek v3.2、MiniMax 2.7、LLaMA 3.3、Qwen3)在七种语言变体上的跨语言语义解析性能。结果显示,从英文到印度语言的性能下降了9.00%,揭示了由更难的模式链接、增加的结构歧义以及有限外部知识驱动的“印度鸿沟”。IndicDB为多语言文本到SQL提供了严密的基准测试。代码与数据:https://anonymous.4open.science/r/multilingualText2Sql-Indic--DDCC/。

关键词

引用

@article{arxiv.2604.13686,
  title  = {IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages},
  author = {Aviral Dawar and Roshan Karanth and Vikram Goyal and Dhruv Kumar},
  journal= {arXiv preprint arXiv:2604.13686},
  year   = {2026}
}

备注

Under Review