中文

一种新的编码代码并辅助代码理解的方法

人工智能 2025-03-25 v2

摘要

一些公司(如微软研究院和谷歌深度智能)发现了 GPT 类模型在自回归范式下的局限性,这些局限性表现为模型缺乏规划、工作记忆、回溯和推理能力。GPT 类模型依赖于局部且贪婪地生成下一个单词,无法对任务或输出进行全局理解。我们通过针对代码理解的专业经验研究确认了上述局限性。尽管 GPT-4 在生成流畅连贯的文本方面表现良好,但它无法处理复杂逻辑,无法生成未见过的新代码,且过度依赖提示的格式来生成正确代码。我们提出了一种超越下一个单词预测范式的代码理解方法,灵感来自于扩散技术在图像生成(Dalle-2、Sora)和蛋白质结构生成(AlphaFold-3)中的成功应用,这些方法没有自回归限制。我们将代码编码为一种类似自然语言的形式,编码为一种既模仿图像又模仿蛋白质结构的异构图像范式,并搭载全局信息记忆。随后,我们借鉴 Sora 的 CLIP 上游文本到图像编码器模型,设计了一个可应用于各种下游代码理解任务的文本到代码编码器模型。该模型在新的异构图像范式下学习代码的全局理解,连接文本和代码的编码空间,将输入的文本编码为与之最相似的代码向量。通过在 456,360 组文本-代码对上进行自监督比较学习,该模型实现了零样本预测新数据的能力。本工作是未来在新的范式下使用扩散技术进行代码生成的基础,以避免自回归局限性。

关键词

引用

@article{arxiv.2408.00521,
  title  = {A new approach for encoding code and assisting code understanding},
  author = {Mengdan Fan and Wei Zhang and Haiyan Zhao and Zhi Jin},
  journal= {arXiv preprint arXiv:2408.00521},
  year   = {2025}
}

备注

10 page, 14 figures