中文

关于以数据为中心任务的合成澄清与修正对话——一种教师-学生方法

计算与语言 2025-03-19 v1

摘要

用于解决以数据为中心任务的AI助手真实对话往往因用户或数据中提供的不完美信息而遵循动态、不可预测的路径,这些信息必须被捕捉并处理。开发能够捕捉此类用户-AI交互的数据集既困难又耗时。在本工作中,我们开发了一种新颖的框架,用于为用户与AI助手之间的受控多轮对话进行合成生成,任务是基于表格的问答,可以从现有数据集中生成,该数据集包含任何目标领域的完整指定的表格QA示例。每次对话旨在通过协作努力解决一个基于表格的推理问题,模拟两种真实场景之一:(1) AI发起的澄清,或(2) 用户发起的修正。关键的是,我们采用一个强大的教师LLM来验证合成对话的正确性,确保高质量。我们展示了从TAT-QA和WikiTableQuestions生成的合成数据集,作为前沿LLM的基准。我们发现即使更大的模型也难以有效地提出澄清问题并准确地整合用户反馈以进行修正。

关键词

引用

@article{arxiv.2503.14167,
  title  = {Synthetic Clarification and Correction Dialogues about Data-Centric Tasks -- A Teacher-Student Approach},
  author = {Christian Poelitz and Nick McKenna},
  journal= {arXiv preprint arXiv:2503.14167},
  year   = {2025}
}