中文

用自然数据挑战神经对话模型:记忆网络在增量现象上失效

计算与语言 2017-09-25 v1

摘要

自然、自发的对话以逐词增量的方式进行,并包含多种不流畅现象,如话语/句子中间的犹豫、中断和自我修正。但用于对话处理机器学习方法的训练数据通常被清理或完全合成,以避免此类现象。由此产生的问题是,在此类干净数据上训练的系统如何泛化到真实的自发对话,或者它们是否能在自然发生的对话数据上进行训练。为了回答这个问题,我们通过向Facebook AI Research的bAbI对话数据集系统地添加自然自发的增量对话现象(如重新开始和自我修正),创建了一个名为bAbI+的新语料库。然后,我们探索了最先进的检索模型MemN2N在这个更自然的数据集上的性能。结果表明,MemN2N模型的语义准确率急剧下降;尽管它原则上能够学习处理bAbI+中的结构,但需要不切实际的训练数据量才能做到。最后,我们进一步展示了一个增量式语义解析器——DyLan——在bAbI和bAbI+上均显示出100%的语义准确率,突显了基于语言学知识的对话模型的泛化特性。

关键词

引用

@article{arxiv.1709.07840,
  title  = {Challenging Neural Dialogue Models with Natural Data: Memory Networks Fail on Incremental Phenomena},
  author = {Igor Shalyminov and Arash Eshghi and Oliver Lemon},
  journal= {arXiv preprint arXiv:1709.07840},
  year   = {2017}
}

备注

9 pages, 3 figures, 2 tables. Accepted as a full paper for SemDial 2017