编码三角:大语言模型如何理解代码?
计算与语言
2025-07-09 v1 人工智能
计算机视觉与模式识别
摘要
大语言模型 (LLM) 在代码生成方面取得了显著进展,但其真正的编程能力仍未得到充分探索。我们提出 Code Triangle 框架,系统评估 LLM 在三个基本维度上的表现:编辑分析、代码实现和测试用例生成。通过对竞赛编程基准进行大规模实验,我们发现尽管 LLM 可在这些维度上形成自洽系统,但其解决方案往往缺乏人类程序员的多样性和鲁棒性。我们识别出模型认知与人类专长之间存在显著分布迁移,模型错误倾向于因训练数据偏差和推理迁移受限而聚集。我们的研究表明,引入人类生成的编辑论述、解决方案和多样化测试用例,以及利用模型混合技术,可显著提升 LLM 的性能和鲁棒性。此外,我们揭示了 LLM 认知中的一致性与不一致性,这可能促进自我反思和自我改进,为开发更强大的编码模型提供了潜在方向。
关键词
引用
@article{arxiv.2507.06137,
title = {NeoBabel: A Multilingual Open Tower for Visual Generation},
author = {Mohammad Mahdi Derakhshani and Dheeraj Varghese and Marzieh Fadaee and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2507.06137},
year = {2025}
}
备注
34 pages, 12 figures