中文

少样本困境:过度提示大型语言模型

计算与语言 2025-09-17 v1

摘要

过度提示现象——即提示中示例数量过多导致大型语言模型 (LLM) 性能下降——挑战了关于基于情境的少样本学习的常规观念。为调查此少样本困境,我们构建了一个提示框架,利用三种标准的少样本选择方法——随机采样、语义嵌入和 TF-IDF 向量——并在多个 LLM 上进行评估,包括 GPT-4o、GPT-3.5-turbo、DeepSeek-V3、Gemma-3、LLaMA-3.1、LLaMA-3.2 和 Mistral。我们的实验结果表明,将过多的领域特定示例纳入提示会在某些 LLM 中导致性能下降,这与此前关于更多相关少样本示例普遍有益于 LLM 的经验结论相矛盾。鉴于 LLM 辅助软件工程和需求分析的趋势,我们实验了两个真实的软件需求分类数据集。通过逐步增加 TF-IDF 选择的和分层抽样的少样本示例数量,我们确定每个 LLM 的最佳数量。这种结合方法以更少的示例实现了优异的性能,避免了过度提示问题,从而将功能和非功能需求分类的 SOTA 提高了 1%。

关键词

引用

@article{arxiv.2509.13196,
  title  = {The Few-shot Dilemma: Over-prompting Large Language Models},
  author = {Yongjian Tang and Doruk Tuncel and Christian Koerner and Thomas Runkler},
  journal= {arXiv preprint arXiv:2509.13196},
  year   = {2025}
}

备注

accepted for the main track of FLLM