中文

基于词嵌入数据增强的提升域外话语检测

计算与语言 2020-03-30 v3

摘要

对于大多数智能助手系统,具备自动检测域外(OOD)话语以妥善处理噪声输入的机制至关重要。一种典型方法是引入一个单独类别,将包含 OOD 话语示例的样本与域内文本样本一同送入分类器。然而,由于 OOD 话语在训练集中通常不可见,检测性能在很大程度上依赖于所附 OOD 文本数据的质量,而受计算限制样本量有限。本文中,我们研究了在小样本量下基于采样的增强 OOD 数据如何影响 OOD 话语检测。我们假设,若随机选取的 OOD 话语样本分布更分散,则可增加未知 OOD 话语空间的覆盖度并提升检测准确率。实验表明,在给定相同数据集与相同 OOD 样本量时,OOD 样本越分散,OOD 话语检测性能越好。

关键词

引用

@article{arxiv.1911.10439,
  title  = {Enhancing Out-Of-Domain Utterance Detection with Data Augmentation Based on Word Embeddings},
  author = {Yueqi Feng and Jiali Lin},
  journal= {arXiv preprint arXiv:1911.10439},
  year   = {2020}
}

备注

I see some improvements that can be done. There will be a major change regarding the main idea