基于内动量优化的 In-Context Learning 状态向量
计算与语言
2024-07-08 v2 人工智能
摘要
大型语言模型(LLMs)展现出强大的仅凭少量示例即可进行情境学习(In-Context Learning, ICL)的能力。近期研究表明,ICL 所学函数可通过从 Transformer 中派生的压缩向量表示。然而,这些向量的工作机制与优化仍需深入探讨。本文据此提出全面分析,这些压缩向量可类比通过梯度下降训练的参数,并引入状态向量(state vector)的概念。灵感来自模型汤(model soup)及动量式梯度下降相关工作,我们提出内动量优化方法,用于在测试时动态调整中优化状态向量。此外,我们模拟了在多示例场景中的状态向量聚合,其中包含大量示例的演示通常难以适用于常规 ICL,进而提出分治式聚合方法以解决此挑战。我们针对 Llama-2 和 GPT-J 在零样本与少量样本情境下开展广泛实验。实验结果表明,所提优化方法有效提升状态向量并在多样化任务上实现最先进性能。代码已公开于 https://github.com/HITsz-TMG/ICL-State-Vector。
关键词
引用
@article{arxiv.2404.11225,
title = {In-Context Learning State Vector with Inner and Momentum Optimization},
author = {Dongfang Li and Zhenyu Liu and Xinshuo Hu and Zetian Sun and Baotian Hu and Min Zhang},
journal= {arXiv preprint arXiv:2404.11225},
year = {2024}
}
备注
17 pages, 7 figures, 5 tables