中文

面向对话状态跟踪中复制机制的数据增强

计算与语言 2020-02-25 v1

摘要

尽管若干最先进的对话状态跟踪(DST)方法在多个基准上展现出有前景的性能,在已见槽值(即训练集与测试集均出现的值)与未见槽值(训练集出现但测试集未出现的值)之间仍存在显著性能差距。近来,复制机制被广泛用于 DST 模型以处理未见槽值,其直接从用户话语复制槽值。在本文中,我们旨在找出影响通用复制机制 DST 模型泛化能力的因素。我们的关键观察包括:1) 复制机制倾向于记忆值而非从上下文中推断,这是泛化性能不佳的主要原因;2) 训练集中槽值多样性越大,在未见值上性能越高,但在已见值上性能略有下降。此外,我们提出一种简单而有效的数据增强算法来训练复制机制模型,其通过复制用户话语并将真实槽值替换为随机生成字符串来扩充输入数据集。用户可使用两个超参数实现已见值与未见值性能之间的权衡,以及整体性能与计算成本之间的权衡。在三个广泛使用的数据集(WoZ 2.0、DSTC2 和 Multi-WoZ 2.0)上的实验结果表明了我们方法的有效性。

关键词

引用

@article{arxiv.2002.09634,
  title  = {Data Augmentation for Copy-Mechanism in Dialogue State Tracking},
  author = {Xiaohui Song and Liangjun Zang and Yipeng Su and Xing Wu and Jizhong Han and Songlin Hu},
  journal= {arXiv preprint arXiv:2002.09634},
  year   = {2020}
}