中文

ILLUMINER:指令微调大语言模型作为小样本意图分类器和槽填充器

计算与语言 2024-03-27 v1

摘要

最先进的意图分类和槽填充方法通常依赖数据密集型的深度学习模型,限制了其在工业应用中的实用性。另一方面,大语言模型,特别是经过指令微调的模型,在各种自然语言任务中展现出卓越的零样本性能。本研究在流行的意图分类和槽填充基准数据集上评估指令微调大语言模型,重点关注其从少量样本中学习的能力。我们提出ILLUMINER方法,将意图分类和槽填充构建为指令微调大语言模型的语言生成任务,并采用了一种比先前工作更高效的槽填充提示方法。与多个基线的全面比较表明,我们使用FLAN-T5 11B模型的方法,在槽填充方面尤其以11.1至32.2个百分点的优势,超越了最先进的联合意图分类与槽填充方法以及使用GPT3.5(175B)的上下文学习方法。此外,我们深入的消融研究表明,参数高效微调仅需不到6%的训练数据即可达到与传统全权重微调相当的性能。

关键词

引用

@article{arxiv.2403.17536,
  title  = {ILLUMINER: Instruction-tuned Large Language Models as Few-shot Intent Classifier and Slot Filler},
  author = {Paramita Mirza and Viju Sudhi and Soumya Ranjan Sahoo and Sinchana Ramakanth Bhat},
  journal= {arXiv preprint arXiv:2403.17536},
  year   = {2024}
}

备注

Accepted at LREC-COLING 2024