面向对话系统的数据高效方法
计算与语言
2020-12-08 v1
摘要
对话式用户界面(CUI)已在日常生活中无处不在,见于 Siri 和 Alexa 等面向消费者的产品,或面向业务的解决方案。深度学习支撑了对话系统许多近期突破,但需要非常大量的训练数据,且常由专家标注。以较少数据训练时,这些方法最终严重缺乏鲁棒性(例如对不流利输入和域外输入的鲁棒性),且往往泛化能力过弱。本论文通过引入一系列以极少数据训练鲁棒对话系统的方法,解决上述问题。首先,我们从数据效率视角研究两种正交的对话方法:语言信息驱动与基于机器学习的方法。我们概述了以任一方法获得数据高效解决方案的步骤。随后,我们引入两个用于对话回复生成的数据高效模型:基于潜变量对话表示的对话知识迁移网络,以及混合生成-检索 Transformer 模型(在 DSTC 8 快速域适应任务中排名第一)。接下来,我们解决极小数据下的鲁棒性问题。为此,提出一个基于多任务 LSTM 的模型用于域通用不流利检测。针对域外输入问题,我们提出 Turn Dropout,一种仅使用域内数据进行异常检测的数据增强技术,并引入自编码器增强的模型以配合 Turn Dropout 高效训练。最后,我们聚焦于社交对话,引入一个用于 Alana 中社交对话回复排序的神经模型,Alana 是 Amazon Alexa Prize 2017 与 2018 的季军。我们采用预测对话长度作为主排序目标的新技术,并表明该方法在数据效率上优于基于评分的对应方法,同时性能与之相当。
引用
@article{arxiv.2012.02929,
title = {Data-Efficient Methods for Dialogue Systems},
author = {Igor Shalyminov},
journal= {arXiv preprint arXiv:2012.02929},
year = {2020}
}
备注
PhD thesis submitted at Heriot-Watt University. Contains previously published work (see the list in Section 1.4)