面向大语言模型的优化启发式少样本适应
机器学习
2025-05-27 v1
摘要
大型语言模型(LLMs)在实际应用中已显示出惊人的性能。然而,通过微调适应LLMs以处理新任务通常需要大量训练数据和计算资源,在少样本场景中往往不可行。现有方法,如情境学习和参数高效微调(PEFT),面临关键限制:情境学习在推理时引入额外的计算开销且性能提升有限,而PEFT模型容易在少量示例上过拟合。本文我们将LLM的前向传递重新解释为优化过程,是一个一系列经过预条件化的梯度下降步骤,以细化内部表示。基于这一联系,我们提出优化启发式少样本适应(OFA),集成一种在不引入额外可训练参数的情况下学习预条件器的参数化方法,以及一种改进优化效率的目标,该目标基于收敛界学习预条件器,同时引导优化路径走向平坦的局部最小值。我们的方法克服了基于ICL和PEFT的方法的两大局限,实验在多种少样本适应任务上显示出优于现有方法的优越性能。
引用
@article{arxiv.2505.19107,
title = {Optimization-Inspired Few-Shot Adaptation for Large Language Models},
author = {Boyan Gao and Xin Wang and Yibo Yang and David Clifton},
journal= {arXiv preprint arXiv:2505.19107},
year = {2025}
}