许多Shot提示失败:LLM代码翻译的实证研究
软件工程
2025-12-10 v2 人工智能
计算与语言
编程语言
摘要
拥有广阔上下文窗口的大型语言模型(LLM)为上下文学习(ICL)提供了新的途径,其中通常假设通过提供大量示例(“many-shot”提示)可提升性能。我们针对复杂的代码翻译任务调查了这一假设。通过对90,000多次翻译的大规模实证研究,系统评估了从zero-shot扩展到最多625个示例的many-shot配置的影响,提示量从约100,000个token扩展到800,000个token。我们的发现揭示了“many-shot悖论”:尽管静态相似度指标在更多示例下可能略有提升,但功能正确性始终在few-shot提示(5-25个示例)时达到峰值。提供大量示例往往会导致这一关键功能性能下降。这一研究表明,对于代码翻译,少数几个精心挑选的示例的质量远胜于数量的多少,挑战了“更多即更好”在ICL中的普遍有效性,并凸显了最佳提示策略具有任务依赖性。我们的结果对有效利用LLM进行软件工程具有重大意义。
关键词
引用
@article{arxiv.2510.16809,
title = {When Many-Shot Prompting Fails: An Empirical Study of LLM Code Translation},
author = {Amirkia Rafiei Oskooei and Kaan Baturalp Cosdan and Husamettin Isiktas and Mehmet S. Aktas},
journal= {arXiv preprint arXiv:2510.16809},
year = {2025}
}
备注
Accepted to ICSE 2026 (RECODE workshop)