中文

用于高效少样本微调的上下文学习蒸馏

计算与语言 2024-12-19 v1

摘要

我们在 OPT-1.3B 模型上针对自然语言推理任务应用了少样本上下文学习,并采用知识蒸馏将上下文信息内化,将模型参数量从 1.3B 减少到 125M,实现了从 2.5GB 到 0.25GB 的体积缩减。与在同等规模模型上单独使用上下文学习相比,这种上下文蒸馏方法在域外准确率上提升了近 50%,展现出优于基于提示方法的知识迁移能力。此外,与传统的基于模式的微调相比,该方法在将内存消耗降低高达 60% 的同时,域外准确率提升了 20%。

关键词

引用

@article{arxiv.2412.13243,
  title  = {In-Context Learning Distillation for Efficient Few-Shot Fine-Tuning},
  author = {Yifei Duan and Liu Li and Zirui Zhai and Jinxia Yao},
  journal= {arXiv preprint arXiv:2412.13243},
  year   = {2024}
}

备注

7 pages, 6 figures