中文

压缩大量样本的基于注意力的 In-Context 学习

机器学习 2025-10-21 v1 人工智能

摘要

大型语言模型(LLMs)已被证明能够通过给定大量输入输出示例/演示(称为“shots”)来通过注意力式学习(In-Context Learning, ICL)完成不同任务。增加样本数量(称为“shots”)可提高下游任务性能,但会导致更高的内存和计算成本。本文研究了通过压缩 many-shot 提示来提高 ICL 推理内存和计算效率的方法。给定包含 t 个标记的大量 shots,我们的目标是生成 m 个软标记摘要,其中 m < t。我们首先表明,现有的提示压缩方法对 many-shot 压缩无效,且仅使用更少的 shots 作为基线反而意外地很强。为实现有效压缩,我们发现:(a)更强的压缩模型需要更多可训练参数;(b)在每个变压器层级压缩 many-shot 表示可实现更细粒度的压缩,为每个层级提供自己的压缩表示。基于这些见解,我们提出了 MemCom,即一种基于层级的压缩方法。我们在不同模型规模(2B 和 7B)、架构(Gemma 和 Mistral)、many-shot 序列长度(3k-6k 标记)和压缩比(3 倍至 8 倍)上系统评估了各种压缩器模型和训练方法。MemCom 在所有压缩比例上均优于强基线,在多个大标签集分类任务上表现突出。值得注意的是,虽然基线在更高压缩比例下性能会急剧下降,通常下降 20-30%,但 MemCom 能保持高准确率,通常仅下降不足 10%。

关键词

引用

@article{arxiv.2510.16092,
  title  = {Compressing Many-Shots in In-Context Learning},
  author = {Devvrit Khatri and Pranamya Kulkarni and Nilesh Gupta and Yerram Varun and Liqian Peng and Jay Yagnik and Praneeth Netrapalli and Cho-Jui Hsieh and Alec Go and Inderjit S Dhillon and Aditya Kusupati and Prateek Jain},
  journal= {arXiv preprint arXiv:2510.16092},
  year   = {2025}
}