面向任务型对话中无监督域外检测的对数似然比与生成式分类器
计算与语言
2020-01-01 v1 人工智能
摘要
在测试时直接识别域外(OOD)输入样本的任务,因模型实际部署的增多而近期重新受到关注。本文关注面向任务型对话系统的自然语言句子输入的OOD检测。我们的发现有三方面:首先,我们整理并发布了ROSTD(来自任务型对话的真实域外句子)——一个包含4K个OOD样本的数据集,基于(Schuster等人2019)的公开数据集。与通过保留部分类别来合成OOD样本的现有设定不同,我们的样本由标注者依据先验指令撰写,相对于已有数据集中的句子为域外。其次,我们探索基于似然比的方法,作为当前主流范式的替代。具体而言,我们重新表述并将这些方法应用于自然语言输入。我们发现它们在所有数据集上匹配或优于后者,在如我们数据集这类非人工OOD基准上提升更大。我们的消融实验证实,具体而言使用似然比而非普通似然,对于区分OOD与域内数据是必要的。第三,我们提出学习一个生成式分类器并计算边际似然(比)用于OOD检测。这使我们能够使用有原则的似然,同时利用训练时的标签。我们发现该方法优于简单的似然(比)基线和其它已有方法。我们迄今是首个研究在测试时使用生成式分类器进行OOD检测的。
引用
@article{arxiv.1912.12800,
title = {Likelihood Ratios and Generative Classifiers for Unsupervised Out-of-Domain Detection In Task Oriented Dialog},
author = {Varun Gangal and Abhinav Arora and Arash Einolghozati and Sonal Gupta},
journal= {arXiv preprint arXiv:1912.12800},
year = {2020}
}
备注
Accepted for AAAI-2020 Main Track