中文

挖掘 Seq2Seq 模型作为鲁棒少样本学习器的潜力

计算与语言 2024-08-28 v2 人工智能

摘要

上下文学习相较于微调具有显著优势,主要在仅解码器模型中观察到,而编码器-解码器(即 seq2seq)模型在依赖权重更新的方法中表现出色。最近,少数研究证明了使用 seq2seq 模型进行少样本学习的可行性;然而,这仅限于与 seq2seq 架构契合良好的任务,如摘要生成和翻译。受这些初步研究的启发,我们首次开展了广泛实验,在广泛任务上比较仅解码器与编码器-解码器模型的上下文少样本学习能力。此外,我们提出两种更有效措施以激发 seq2seq 模型的上下文学习能力:目标对齐提示法与基于融合的方法。值得注意的是,我们的方法优于规模大六倍的仅解码器模型,并在多种设置下相较传统 seq2seq 模型表现出显著性能提升。我们认为,在正确配置与提示设计下,seq2seq 模型可成为广泛应用下高效的少样本学习器。

关键词

引用

@article{arxiv.2307.14856,
  title  = {Exploiting the Potential of Seq2Seq Models as Robust Few-Shot Learners},
  author = {Jihyeon Lee and Dain Kim and Doohae Jung and Boseop Kim and Kyoung-Woon On},
  journal= {arXiv preprint arXiv:2307.14856},
  year   = {2024}
}

备注

Accepted to COLM'2024