中文

迈向计算最优多样本上下文学习

计算与语言 2025-09-03 v2 人工智能 机器学习

摘要

长上下文大语言模型(LLM)能够处理包含多达数百万 token 的输入。在上下文学习(ICL)的范畴内,这意味着在输入提示词中使用数百/数千个示例,从而实现多样本 ICL。在实践中,在多样本设置下,通常随机选择固定的一组示例,原因在于:(1) 高昂的推理成本;(2) 缓存和重用计算的好处;(3) 该策略在规模扩展时与其他策略相比表现出相似的性能。在本工作中,我们提出了两种用于多样本 ICL 中示例选择的直接策略,以最小的计算开销提升性能。我们的第一种方法将少量基于与每个测试样本相似度选择的示例,与数量不成比例地多的被缓存的随机示例相结合。第二种策略通过使用由测试样本表示经 k-means 聚类导出的质心来替换随机示例,从而改进了第一种方法。我们在多个数据集上使用 Gemini Pro 和 Flash 进行的实验表明,我们的策略始终优于随机选择,并且超越或匹配了性能最优的选择方法,同时支持缓存并将推理成本降低多达一个数量级。我们还表明,调整基于不同标准选择的示例比例可以在多样本 ICL 中平衡性能和推理成本。

关键词

引用

@article{arxiv.2507.16217,
  title  = {Towards Compute-Optimal Many-Shot In-Context Learning},
  author = {Shahriar Golchin and Yanfei Chen and Rujun Han and Manan Gandhi and Tianli Yu and Swaroop Mishra and Mihai Surdeanu and Rishabh Agarwal and Chen-Yu Lee and Tomas Pfister},
  journal= {arXiv preprint arXiv:2507.16217},
  year   = {2025}
}

备注

Final version; accepted at COLM 2025