中文

面向医疗文本到SQL模型与数据集泛化能力的理解

计算与语言 2023-03-24 v1

摘要

电子病历(EMRs)存储在关系型数据库中。如果用户不熟悉数据库模式或通用数据库基础知识,访问所需信息可能具有挑战性。因此,研究者已探索文本到SQL生成方法,使医疗专业人员无需数据库专家即可直接访问EMR数据。然而,当前可用的数据集基本上已被“解决”,最先进模型达到了大于或接近90%的准确率。在本文中,我们表明在解决医疗领域文本到SQL生成之前仍有很长的路要走。为此,我们创建现有医疗文本到SQL数据集 MIMICSQL 的新划分,以更好地衡量所得模型的泛化能力。我们在新划分上评估最先进的语言模型,显示性能大幅下降,准确率从最高92%降至28%,从而表明仍有很大改进空间。此外,我们引入一种新颖的数据增强方法来改善语言模型的泛化能力。总体而言,本文是开发医疗领域更鲁棒文本到SQL模型的第一步。\footnote{数据集与代码将在录用后发布。}

关键词

引用

@article{arxiv.2303.12898,
  title  = {Towards Understanding the Generalization of Medical Text-to-SQL Models and Datasets},
  author = {Richard Tarbell and Kim-Kwang Raymond Choo and Glenn Dietrich and Anthony Rios},
  journal= {arXiv preprint arXiv:2303.12898},
  year   = {2023}
}