基于伪造数据增强的上下文域外话语处理
计算与语言
2019-05-27 v1
摘要
神经对话模型往往缺乏对异常用户输入的鲁棒性,并产生不恰当的回复,导致令人沮丧的用户体验。尽管已有一些已有的域外(OOD)话语检测方法,它们存在若干限制:依赖OOD数据或多个子域,且其OOD检测独立于上下文,导致在对话中性能次优。本文的目标是提出一种新颖的OOD检测方法,该方法通过在对话上下文中利用伪造的OOD轮次,从而无需OOD数据。为促进进一步研究,我们还发布了新的对话数据集,即3个公开可用的对话语料库,以可控方式增强了OOD轮次。在存在OOD话语的情况下,我们的方法以较大优势优于配备常规OOD检测机制的SOTA对话模型。
引用
@article{arxiv.1905.10247,
title = {Contextual Out-of-Domain Utterance Handling With Counterfeit Data Augmentation},
author = {Sungjin Lee and Igor Shalyminov},
journal= {arXiv preprint arXiv:1905.10247},
year = {2019}
}
备注
ICASSP 2019