多Shot 提示在 LLM 代码翻译中的失效:一次实证研究
机器学习
2025-10-24 v2 人工智能
摘要
拥有广阔上下文窗口的大型语言模型 (LLM) 为通过上下文学习 (in-context learning, ICL) 提供了新的途径,其中提供大量示例 (many-shot 提示) 常被假设能提升性能。我们针对复杂的代码翻译任务,对此假设进行调查。通过对 9 万余次翻译的大规模实证研究,系统评估了从 zero-shot 扩展至最多 625 个示例的 many-shot 配置对性能的影响,提示规模从约 10 万 token 扩展至 80 万 token。我们的发现揭示了“many-shot 矛盾现象”:尽管静态相似度指标在获得更多示例后可能略有提升,但功能正确性始终在 few-shot 提示 (5-25 个示例) 时达到峰值。提供大量示例往往会损害这一关键功能性能。这一研究表明,对于代码翻译,少数几个高质量精选示例的作用远胜于数量的堆砌,挑战了“更多即更好”在 ICL 中普遍适用的假设,强调了最佳提示策略的任务依赖性。我们的结果对有效利用 LLM 进行软件工程具有重大意义。
关键词
引用
@article{arxiv.2510.16807,
title = {Improving Model Representation and Reducing KV Cache via Skip Connections with First Value Heads},
author = {Zhoutong Wu and Yuan Zhang and Yiming Dong and Chenheng Zhang and Cong Fang and Kun Yuan and Zhouchen Lin},
journal= {arXiv preprint arXiv:2510.16807},
year = {2025}
}
备注
The code is available at: \url{https://github.com/Zhoutong-Wu/SkipV1Former}