中文

利用复述生成快速启动对话系统

计算与语言 2022-05-05 v2

摘要

获取训练数据以提升对话系统的鲁棒性可能是一个极其漫长的过程。在这项工作中,我们提出一种方法,通过使用复述生成从现有样本中人工生成更多数据,从而降低创建新对话智能体的成本与工作量。我们提出的方法能以极少的人力启动一个对话系统,并将其性能提升至足以允许与真实终端用户实际交互的满意水平。我们尝试了两种神经复述方法,即神经机器翻译和基于 Transformer 的 seq2seq 模型。我们展示了在英语和法语两个数据集上获得的结果:一个众包公开意图分类数据集和我们自己的企业对话系统数据集。我们表明,我们提出的方法提升了意图分类模型在两个数据集上的泛化能力,减少了初始化新对话系统所需的工作量,并有助于在组织内部大规模部署该技术。

关键词

引用

@article{arxiv.2204.02546,
  title  = {Quick Starting Dialog Systems with Paraphrase Generation},
  author = {Louis Marceau and Raouf Belbahar and Marc Queudot and Nada Naji and Eric Charton and Marie-Jean Meurs},
  journal= {arXiv preprint arXiv:2204.02546},
  year   = {2022}
}