Columbo:使用大语言模型扩展表格中缩写列名
计算与语言
2025-09-24 v3 数据库
摘要
扩展表格中缩写列名(如将 "esal" 扩展为 "employee salary")对于诸多下游 NLP 任务至关重要,这些任务包括 NL2SQL、表格问答和关键词搜索。该问题在企业、科学领域、政府机构等场景中广泛存在。本文作出三项突破性贡献:其一,指出 prior work 使用的合成公开数据存在重大局限,本文引入四个来自企业/科学领域的真实世界缩写数据集;其二,指出 prior work 采用的准确率度量严重低估了正确扩展的结果,本文提出新型的同义词感知度量,能够更准确地衡量效果;其三,开发了 Columbo,一种强大的基于大语言模型的解决方案,利用上下文、规则、链式思考推理及 token 级分析。大量实验表明,Columbo 在五个数据集上相较于当前最先进的 NameGuess 模型显著提升 4-29%。Columbo 已在环境科学的数据湖 EDI 中投入生产使用。
引用
@article{arxiv.2508.09403,
title = {Columbo: Expanding Abbreviated Column Names for Tabular Data Using Large Language Models},
author = {Ting Cai and Stephen Sheen and AnHai Doan},
journal= {arXiv preprint arXiv:2508.09403},
year = {2025}
}
备注
Accepted to Findings of EMNLP 2025; 19 pages, 14 figures