中文

用于意图分类与超出范围预测的评测数据集

计算与语言 2019-09-06 v1 人工智能 机器学习

摘要

任务型对话系统需要知道何时一个查询落在其支持的意图范围之外,但当前的文本分类语料库仅定义了覆盖每个示例的标签集。我们引入了一个新数据集,其中包含超出范围的查询——即不属于系统任何受支持意图的查询。这带来了新的挑战,因为模型不能假设推理时的每个查询都属于系统支持的意图类别。我们的数据集还覆盖了 10 个领域上的 150 个意图类别,捕捉了生产型任务型智能体必须处理的广度。我们 along with 若干不同的超出范围识别方案在我们的数据集上评估了一系列基准分类器。我们发现,虽然分类器在范围内意图分类上表现良好,但它们难以识别超出范围的查询。我们的数据集与评测填补了该领域的重要空白,提供了一种在任务驱动对话系统中更严格、更真实地基准测试文本分类的方法。

关键词

引用

@article{arxiv.1909.02027,
  title  = {An Evaluation Dataset for Intent Classification and Out-of-Scope Prediction},
  author = {Stefan Larson and Anish Mahendran and Joseph J. Peper and Christopher Clarke and Andrew Lee and Parker Hill and Jonathan K. Kummerfeld and Kevin Leach and Michael A. Laurenzano and Lingjia Tang and Jason Mars},
  journal= {arXiv preprint arXiv:1909.02027},
  year   = {2019}
}

备注

Accepted to EMNLP-IJCNLP 2019