用于高效少样本微调的上下文学习蒸馏
计算与语言
2024-12-19 v1
摘要
我们在 OPT-1.3B 模型上针对自然语言推理任务应用了少样本上下文学习,并采用知识蒸馏将上下文信息内化,将模型参数量从 1.3B 减少到 125M,实现了从 2.5GB 到 0.25GB 的体积缩减。与在同等规模模型上单独使用上下文学习相比,这种上下文蒸馏方法在域外准确率上提升了近 50%,展现出优于基于提示方法的知识迁移能力。此外,与传统的基于模式的微调相比,该方法在将内存消耗降低高达 60% 的同时,域外准确率提升了 20%。
引用
@article{arxiv.2412.13243,
title = {In-Context Learning Distillation for Efficient Few-Shot Fine-Tuning},
author = {Yifei Duan and Liu Li and Zirui Zhai and Jinxia Yao},
journal= {arXiv preprint arXiv:2412.13243},
year = {2024}
}
备注
7 pages, 6 figures