NameGuess:面向表格数据的列名扩展
计算与语言
2023-10-23 v1 数据库
机器学习
摘要
大语言模型的最新进展给包括数据库行业在内的许多领域带来了变革。在处理大量表格数据时,一个常见挑战是普遍使用缩写的列名,这会对各种数据搜索、访问与理解任务的表现产生负面影响。为解决此问题,我们提出一项称为 NameGuess 的新任务,将(数据库模式中使用的)列名扩展作为一个自然语言生成问题。我们利用一种新的数据构造方法创建了一个包含 38.4 万对缩写—扩展列名的训练数据集,以及一个由真实世界表格中 9200 个示例组成的人工标注评测基准。为应对 NameGuess 中多义性与歧义性相关的复杂性,我们通过以表内容与列标题名为条件来增强自回归语言模型——由此得到一个微调模型(含 27 亿参数),其表现可与人类持平。此外,我们进行了全面分析(在多个 LLM 上)以验证表内容在 NameGuess 中的有效性,并指出了有前景的未来方向。代码已发布于 https://github.com/amazon-science/nameguess。
引用
@article{arxiv.2310.13196,
title = {NameGuess: Column Name Expansion for Tabular Data},
author = {Jiani Zhang and Zhengyuan Shen and Balasubramaniam Srinivasan and Shen Wang and Huzefa Rangwala and George Karypis},
journal= {arXiv preprint arXiv:2310.13196},
year = {2023}
}
备注
This work has been accepted to EMNLP'23