中文

面向零样本与少样本意图分类的意图感知编码器预训练

计算与语言 2023-11-15 v2

摘要

意图分类(IC)在任务型对话系统中起着重要作用。然而,当每个用户意图缺乏足够的标注样本时,IC模型的泛化能力往往较差。我们提出了一种新颖的文本编码器预训练方法,利用带意图伪标签的对比学习来生成非常适合IC任务的嵌入表示,从而减少对人工标注的需求。通过应用该预训练策略,我们还引入了预训练意图感知编码器(PIE),其设计用于将话语的编码与其意图名称对齐。具体而言,我们首先训练一个标注器来识别话语中对意图理解至关重要的关键短语。然后利用这些提取出的短语以对比方式构造样本,用于预训练文本编码器。结果表明,在四个IC数据集上,我们的PIE模型在N类零样本和单样本设定下,准确率比先前最先进的文本编码器分别高出至多5.4%和4.0%。

关键词

引用

@article{arxiv.2305.14827,
  title  = {Pre-training Intent-Aware Encoders for Zero- and Few-Shot Intent Classification},
  author = {Mujeen Sung and James Gung and Elman Mansimov and Nikolaos Pappas and Raphael Shu and Salvatore Romeo and Yi Zhang and Vittorio Castelli},
  journal= {arXiv preprint arXiv:2305.14827},
  year   = {2023}
}

备注

EMNLP 2023