基于 SAFIM 框架的大语言模型上下文感知代码完成比较分析
软件工程
2025-02-24 v1 人工智能
摘要
大语言模型(LLM)的出现彻底改变了代码完成领域,使其成为现代集成开发环境中更智能、更具上下文感知的特性。这些进展显著增强了开发人员编写高效、无错误代码的能力。本研究评估了包括 Gemini 1.5 Flash、Gemini 1.5 Pro、GPT-4o、GPT-4o-mini 和 GPT-4 Turbo 在内的几种基于聊天的 LLM 的性能,这些模型使用 Syntax-Aware Fill-in-the-Middle(SAFIM)数据集进行测试。该基准专为评估模型在语法敏感代码生成方面的能力而设计。采用余弦相似度与 ground-truth 完成项的度量以及延迟等性能指标,衡量模型的准确性和效率。研究结果显示,各模型在代码完成方面的能力存在显著差异,为洞察其各自优势和弱点提供了宝贵的依据。这项工作提供了一种比较分析,凸显了准确性与速度之间的权衡,为未来 LLM 基于代码完成的发展奠定了基准。
引用
@article{arxiv.2502.15243,
title = {Comparative Analysis of Large Language Models for Context-Aware Code Completion using SAFIM Framework},
author = {Hang Zhang and Yanxin Shen and Lun Wang and Chuanqi Shi and Shaoshuai Du and Yiyi Tao and Yixian Shen},
journal= {arXiv preprint arXiv:2502.15243},
year = {2025}
}
备注
9 pages