中文

少样本意图分类中特征空间数据增强的细究

计算与语言 2019-10-11 v1 信息检索 机器学习

摘要

诸如Amazon Alexa和Apple Siri之类的对话式AI智能体不断被加入新的对话主题与功能。由于数据收集与标注不可扩展且往往代价高昂,新功能仅有少量可用样本,导致泛化性能不佳。我们将其表述为一个少样本集成(FSI)问题,即用少量样本引入一个新意图。本文中,我们研究了六种特征空间数据增强方法,以结合有监督与无监督表示学习方法(如BERT)提升FSI设定下的分类性能。通过在SNIPS和Facebook Dialog语料两个公开对话数据集上的真实实验,我们表明特征空间中的数据增强为少样本设定下超越传统迁移学习方法的意图分类性能提升提供了有效途径。具体而言,我们表明:(a) 潜空间上采样是特征空间增强的一个有竞争力的基线;(b) 将两个样本之差加到新样本上是一种简单而有效的数据增强方法。

关键词

引用

@article{arxiv.1910.04176,
  title  = {A Closer Look At Feature Space Data Augmentation For Few-Shot Intent Classification},
  author = {Varun Kumar and Hadrien Glaude and Cyprien de Lichy and William Campbell},
  journal= {arXiv preprint arXiv:1910.04176},
  year   = {2019}
}

备注

Accepted at Deep Learning for low-resource NLP workshop @ EMNLP 2019