中文

基于 RoBERTa 的数据不可知自然语言到 SQL 查询生成

人工智能 2021-03-08 v3 计算与语言

摘要

关系数据库是现代世界中用于存储海量数据最广泛使用的架构之一。然而,这些数据库与普通用户之间存在一道屏障。用户往往缺乏与数据库交互所需的 SQL 等查询语言知识。NL2SQL 任务旨在寻找深度学习方法,通过将自然语言问题转换为有效的 SQL 查询来解决此问题。鉴于某些数据库的敏感性以及日益增长的数据隐私需求,我们提出了一种以数据隐私为核心的方法。我们将 RoBERTa 嵌入与数据不可知知识向量输入基于 LSTM 的子模型以预测最终查询。尽管我们未取得最先进的(SOTA)结果,但我们从根本上消除了模型训练阶段对表数据的需求,并取得了 76.7% 的测试集执行准确率。通过在训练时消除表数据依赖,我们构建了一个仅基于自然语言问题与表模式即可进行零样本学习的模型。

关键词

引用

@article{arxiv.2010.05243,
  title  = {Data Agnostic RoBERTa-based Natural Language to SQL Query Generation},
  author = {Debaditya Pal and Harsh Sharma and Kaustubh Chaudhari},
  journal= {arXiv preprint arXiv:2010.05243},
  year   = {2021}
}

备注

8 Pages, 2 figures