中文

基于精确 ThingTalk 表示的 Wizard-of-Oz 对话少样本语义解析器

计算与语言 2022-04-11 v3

摘要

以往为 Wizard-of-Oz (WOZ) 对话构建有效语义解析器的尝试,受制于难以获取高质量的人工标注训练集。仅基于对话合成的方法是不充分的,因为由基于状态机的模型生成的对话是对现实对话的粗略近似。此外,先前提出的对话状态表示存在歧义,缺乏构建有效智能体所需的精确性。本文提出了一种新的对话表示和一种样本高效的方法,能够预测 WOZ 对话中精确的对话状态。我们扩展了 ThingTalk 表示,以捕捉智能体做出恰当响应所需的全部信息。我们的训练策略是样本高效的:我们结合了 (1) 对完整对话空间进行稀疏采样的少样本数据,以及 (2) 由简明的基于状态的对话模型生成的、覆盖对话子集空间的合成数据。我们用一个完全可操作的智能体证明了扩展 ThingTalk 语言的完备性,该智能体也用于训练数据合成。我们在 MultiWOZ 3.0(即 MultiWOZ 2.1 数据集在 ThingTalk 上的重新标注)上展示了我们方法的有效性。ThingTalk 能够表示 98% 的测试轮次,而模拟器能够模拟 85% 的验证集。我们使用该策略训练了一个上下文语义解析器,并在重新标注的测试集上获得了 79% 的逐轮精确匹配准确率。

关键词

引用

@article{arxiv.2009.07968,
  title  = {A Few-Shot Semantic Parser for Wizard-of-Oz Dialogues with the Precise ThingTalk Representation},
  author = {Giovanni Campagna and Sina J. Semnani and Ryan Kearns and Lucas Jun Koba Sato and Silei Xu and Monica S. Lam},
  journal= {arXiv preprint arXiv:2009.07968},
  year   = {2022}
}

备注

Published in Findings of ACL 2022, 9 pages