Pneuma:利用LLM进行表格数据表示与检索的端到端系统
数据库
2025-04-15 v1 信息检索
摘要
在数据库、湖和存储库中寻找相关表格是从数据中提取价值的第一步。由于评估表格是否与问题相关往往不仅取决于其内容,还取决于上下文,而这种上下文通常是个人或团队间的部落知识。虽然数据目录和学术数据发现系统针对这一问题进行了设计,但它们依赖关键词搜索或更复杂的界面,限制了非技术用户查找相关数据的能力。大型语言模型(LLM)的出现提供了一个独特的机会,让用户直接以自然语言提问,使数据集发现更加直观、可访问和高效。本文中,我们介绍了Pneuma,这是一个检索增强生成(RAG)系统,旨在高效、有效地发现表格数据。Pneuma利用大型语言模型(LLM)进行表格表示和表格检索。对于表格表示,Pneuma保留了模式和行级信息,以确保全面的数据理解。对于表格检索,Pneuma将LLM与传统信息检索技术(如全文检索和向量检索)相补充,充分发挥两者优势以提高检索性能。为评估Pneuma,我们生成了全面的基准,模拟了在包括企业数据、科学数据库、数据仓库和公开数据等六个真实世界数据集上的表格发现工作负载。我们的结果表明,Pneuma在准确性和资源效率方面均优于广泛使用的表格搜索系统(如全文检索和最先进的RAG系统)。
引用
@article{arxiv.2504.09207,
title = {Pneuma: Leveraging LLMs for Tabular Data Representation and Retrieval in an End-to-End System},
author = {Muhammad Imam Luthfi Balaka and David Alexander and Qiming Wang and Yue Gong and Adila Krisnadhi and Raul Castro Fernandez},
journal= {arXiv preprint arXiv:2504.09207},
year = {2025}
}
备注
SIGMOD 2025 Paper