中文

面向可适应零样本对话状态跟踪的多样化高效合成数据生成

计算与语言 2024-06-14 v2

摘要

我们通过合成数据生成增强训练数据多样性,展示了零样本对话状态跟踪(DST)的显著性能提升。由于数据收集成本高昂,现有 DST 数据集在覆盖的应用领域与槽位类型数量上严重受限,限制了其对新领域的适应性。本研究通过一种新颖的、全自动的数据生成方法应对这一挑战,创建合成零样本 DST 数据集。与以往方法不同,我们的方法能跨越海量应用领域生成对话,并配有银标准对话状态标注与槽位描述。该技术用于创建 D0T 数据集以训练零样本 DST 模型,涵盖前所未有的 1,000 多个领域。在 MultiWOZ 基准上的实验表明,在多样化合成数据上训练模型可将联合目标准确率提升 6.7%,取得与我们大 13.5 倍的模型相竞争的结果。

关键词

引用

@article{arxiv.2405.12468,
  title  = {Diverse and Effective Synthetic Data Generation for Adaptable Zero-Shot Dialogue State Tracking},
  author = {James D. Finch and Jinho D. Choi},
  journal= {arXiv preprint arXiv:2405.12468},
  year   = {2024}
}