探究大语言模型在 Text-to-SQL 翻译中的数据污染影响
计算与语言
2024-12-10 v1 机器学习
摘要
在零样本场景中,理解文本描述以生成代码似乎是指令遵循型大语言模型(LLM)已具备的能力。然而,这种翻译能力极有可能受到模型曾见过目标文本描述及相关代码的影响。这种效应被称为数据污染(Data Contamination)。本研究调查了数据污染对 GPT-3.5 在 Text-to-SQL 代码生成任务中性能的影响。为此,我们引入了一种检测 GPT 中数据污染的新方法,并利用已知的 Spider 数据集和我们新的陌生数据集 Termite 来检验 GPT-3.5 的 Text-to-SQL 性能。此外,我们通过对抗性表断开(adversarial table disconnection, ATD)方法分析了 GPT-3.5 在信息被修改的数据库上的效能,该方法通过移除数据库中的结构信息片段使 Text-to-SQL 任务复杂化。我们的结果表明,即使经过 ATD 修改,GPT-3.5 在陌生的 Termite 数据集上的性能也显著下降,突显了数据污染对 LLM 在 Text-to-SQL 翻译任务中的影响。
引用
@article{arxiv.2402.08100,
title = {Investigating the Impact of Data Contamination of Large Language Models in Text-to-SQL Translation},
author = {Federico Ranaldi and Elena Sofia Ruzzetti and Dario Onorati and Leonardo Ranaldi and Cristina Giannone and Andrea Favalli and Raniero Romagnoli and Fabio Massimo Zanzotto},
journal= {arXiv preprint arXiv:2402.08100},
year = {2024}
}