系统提示对指令调优模型代码生成效果的实证研究
软件工程
2026-02-18 v1
摘要
指令调优语言模型(Instruction-tuned Language Models, ILMs)已成为现代人工智能系统的关键组件,展现出在自然语言和推理任务上的卓越多样性。其中最具影响力的应用之一是代码生成,ILMs——通常称为代码语言模型(Code Language Models, CLMs)——将人类意图转化为可执行程序。尽管进步主要由规模化和训练方法的提升驱动,但一个关键方面仍未得到充分探讨:系统提示对通用ILMs和专用于代码生成的CLMs的影响。我们系统评估了系统提示在不同指令细节程度、模型规模、提示策略和编程语言下对代码助手的影响。我们的实验设置覆盖4个模型、5种系统提示、3种提示策略、2种语言和2种温度setting,共计360种配置。我们发现:(1)增加系统提示的约束性具体化并不一定单调提高正确性——提示效果取决于配置,可能因与任务需求和解码上下文的匹配度不同而帮助或妨碍;(2)对于较大的代码专用模型,few-shot示例相对于零shot生成可能导致性能下降,这与常规观念相矛盾;(3)编程语言 matters,Java对系统提示变化的敏感性显著高于Python,表明可能需要针对不同编程语言制定特定的提示工程策略。
引用
@article{arxiv.2602.15228,
title = {An Empirical Study on the Effects of System Prompts in Instruction-Tuned Models for Code Generation},
author = {Zaiyu Cheng and Antonio Mastropaolo},
journal= {arXiv preprint arXiv:2602.15228},
year = {2026}
}
备注
34 pages, 12 tables, 3 figures