中文

AutoPrep:基于多智能体框架的数据准备自然语言问题感知

计算与语言 2025-07-10 v4 人工智能

摘要

回答关于表格的自然语言(NL)问题,称为表格自然语言问答(TQA),至关重要,因为它允许用户快速高效地从结构化数据中提取有意义的见解,有效地搭建了人类语言与机器可读格式之间的桥梁。许多这些表格来自网络来源或现实场景,需要精细的数据准备(或数据准备)才能确保准确的响应。然而,为NL问题准备此类表格引入了超越传统数据准备的新要求。这种问题感知型数据准备涉及针对特定问题的列派生和筛选,以及问题感知的值规范化或转换,凸显了需要更细致方法的必要性。由于上述任务各不相同,单个模型(或智能体)可能在所有场景中都无法有效运行。本文提出AutoPrep,一个基于大型语言模型(LLM)的多智能体框架,利用多个各自专精于特定类型数据准备的智能体的优势,确保更准确且与上下文相关的响应。给定对表格的NL问题,AutoPrep通过三个关键组件进行数据准备:规划器:确定逻辑计划,概述一系列高层次操作;程序员:通过生成相应的低级代码将逻辑计划转化为物理计划;执行器:执行生成的代码以处理表格。为支持该多智能体框架,我们设计了一种新的链式子句推理机制用于高层次操作建议,以及一种用于低级代码生成的工具增强方法。

关键词

引用

@article{arxiv.2412.10422,
  title  = {AutoPrep: Natural Language Question-Aware Data Preparation with a Multi-Agent Framework},
  author = {Meihao Fan and Ju Fan and Nan Tang and Lei Cao and Guoliang Li and Xiaoyong Du},
  journal= {arXiv preprint arXiv:2412.10422},
  year   = {2025}
}