用于对话状态跟踪数据增强的变分层次对话自编码器
计算与语言
2020-10-08 v3 机器学习
摘要
近期工作表明,生成式数据增强(即由深度生成模型合成的样例补充训练数据集)有益于NLP任务。本文将此方法扩展到面向目标对话的对话状态跟踪任务。由于面向目标对话在话语及相关标注上固有的层次结构,深度生成模型必须能够捕捉不同层次与类型对话特征间的连贯性。我们提出变分层次对话自编码器(Variational Hierarchical Dialog Autoencoder, VHDA)来建模面向目标对话的完整方面,包括语言特征与底层结构化标注,即说话人信息、对话行为和目标。所提架构旨在利用相互连接的潜变量建模面向目标对话的各个方面,并学习从潜空间生成连贯的面向目标对话。为克服训练复杂变分模型时产生的训练问题,我们提出恰当的训练策略。在多个对话数据集上的实验表明,我们的模型通过生成式数据增强提升了下游对话跟踪器的鲁棒性。我们还发现了统一建模面向目标对话方法的额外益处:对话响应生成与用户模拟,其中我们的模型优于以往强基线。
引用
@article{arxiv.2001.08604,
title = {Variational Hierarchical Dialog Autoencoder for Dialog State Tracking Data Augmentation},
author = {Kang Min Yoo and Hanbit Lee and Franck Dernoncourt and Trung Bui and Walter Chang and Sang-goo Lee},
journal= {arXiv preprint arXiv:2001.08604},
year = {2020}
}
备注
11 pages (main) + 9 pages (appendix), 1 figure, 6 tables, accepted to EMNLP 2020