中文

基于逐点 V-信息的意图检测选择性上下文数据增强

计算与语言 2023-02-13 v1 人工智能

摘要

本文关注于意图检测的上下文数据增强。我们发现仅通过大预训练语言模型(PLM)的上下文提示进行增强并不能提升性能,为此引入一种基于 PLM 与逐点 V-信息(PVI)的新方法,PVI 是一种可度量数据点对训练模型有用性的指标。我们的方法首先在一小份种子训练数据上微调 PLM,然后合成对应于给定意图的新数据点;继而基于 PVI 采用意图感知过滤,剔除对下游意图分类器无帮助的数据点。因此,我们的方法能够利用大语言模型的表达能力来生成多样化的训练数据。实证结果表明,在少样本设定下(5-shot 平均绝对提升 1.28%,10-shot 平均绝对提升 1.18%),我们的方法所生成的合成训练数据在三个具有挑战性的意图检测数据集上取得了最先进的性能;在全样本设定下(平均绝对差距在 0.01% 以内)与最先进水平表现相当。

关键词

引用

@article{arxiv.2302.05096,
  title  = {Selective In-Context Data Augmentation for Intent Detection using Pointwise V-Information},
  author = {Yen-Ting Lin and Alexandros Papangelis and Seokhwan Kim and Sungjin Lee and Devamanyu Hazarika and Mahdi Namazifar and Di Jin and Yang Liu and Dilek Hakkani-Tur},
  journal= {arXiv preprint arXiv:2302.05096},
  year   = {2023}
}

备注

Accepted at EACL 2023