中文

利用 ChatGPT 生成用于意图分类的困难负样本域外数据

计算与语言 2024-03-12 v1

摘要

意图分类器必须能够识别用户的语句是否不属于任何支持的意图,以避免产生错误且不相关的系统响应。尽管针对意图分类器的域外(OOS)检测已有研究,但先前的工作尚未研究分类器在面对困难负样本域外语句(即与域内数据共享共同特征但实际上属于域外的输入)时的性能变化。我们提出了一种利用 ChatGPT 生成困难负样本 OOS 数据的自动化技术。我们使用该技术构建了五个新的困难负样本 OOS 数据集,并针对三个基准意图分类器对每个数据集进行了评估。结果表明,分类器在正确识别困难负样本 OOS 语句方面比识别一般 OOS 语句更为困难。最后,我们表明在训练中纳入困难负样本 OOS 数据可以提高模型在检测困难负样本 OOS 数据和一般 OOS 数据时的鲁棒性。我们的技术、数据集和评估填补了该领域的一个重要空白,提供了一种简单且低成本的方法来收集困难负样本 OOS 数据并提高意图分类器的鲁棒性。

关键词

引用

@article{arxiv.2403.05640,
  title  = {Generating Hard-Negative Out-of-Scope Data with ChatGPT for Intent Classification},
  author = {Zhijian Li and Stefan Larson and Kevin Leach},
  journal= {arXiv preprint arXiv:2403.05640},
  year   = {2024}
}

备注

LREC-COLING 2024