中文

适配与分解:基于领域适配最少到最多提示的Text-to-SQL高效泛化

计算与语言 2023-08-10 v3 人工智能 机器学习

摘要

Text-to-SQL语义解析的跨领域与跨组合泛化是一项具有挑战性的任务。现有基于大语言模型(LLM)的方案依赖于推理时从训练集检索少样本示例,为每个自然语言(NL)测试查询合成运行时提示。相比之下,我们设计了一种算法,从训练数据中离线采样一组最小的少样本,完整覆盖SQL子句、操作符与函数,并在允许的词元长度内实现最大领域覆盖。这使得能够为各NL测试查询合成一个固定的通用提示(GP),其中包含通用的多样化示例,避免了昂贵的测试时示例检索。我们进一步将GP自动适配到目标数据库领域(DA-GP),以更好处理跨领域泛化;随后采用分解的最少到最多提示(LTMP-DA-GP)处理跨组合泛化。LTMP-DA-GP的合成是一项离线任务,针对每个新数据库仅需执行一次且人工干预极少。我们的方法在旨在评估Text-to-SQL任务泛化性的KaggleDBQA数据集上展现出优越性能。我们进一步展示了LTMP-DA-GP相较GP在KaggleDBQA的各类LLM与数据库上的一致性能提升,凸显了我们基于提示的适配与分解方法的效能及与模型无关的益处。

关键词

引用

@article{arxiv.2308.02582,
  title  = {Adapt and Decompose: Efficient Generalization of Text-to-SQL via Domain Adapted Least-To-Most Prompting},
  author = {Aseem Arora and Shabbirhussain Bhaisaheb and Harshit Nigam and Manasi Patwardhan and Lovekesh Vig and Gautam Shroff},
  journal= {arXiv preprint arXiv:2308.02582},
  year   = {2023}
}

备注

22 Pages