桥接代码图与大语言模型以提升代码理解
计算与语言
2025-12-09 v1 软件工程
摘要
大语言模型(LLM)在代码生成、摘要和翻译等代码智能任务中展现了显著性能。然而,其对线性化标记序列的依赖限制了其理解程序结构语义的能力。虽然先前研究探索了图增强提示和结构感知预训练,但它们要么受到提示长度约束,要么需要与大规模指令跟随 LLM 不兼容的任务特定架构变更。为解决这些限制,本文提出了 CGBridge,一种新颖的即插即用方法,通过外部可训练桥接模块以代码图信息增强 LLM。CGBridge 首先通过在大规模 27 万个代码图数据集上的自监督学习预训练代码图编码器,以学习结构代码语义。然后训练一个外部模块,通过跨模态注意力机制对齐代码、图和文本的语义,以弥合模态差距。最后,桥接模块生成结构感知的提示,注入到冻结的 LLM 中,并针对下游代码智能任务进行微调。实验表明,CGBridge 在原始模型和图增强提示方法之上取得了显著提升。具体而言,它在代码摘要的 LLM-as-a-Judge 上取得了 16.19% 和 9.12% 的相对提升,在代码翻译的执行准确率上取得了 9.84% 和 38.87% 的相对提升。此外,CGBridge 的推理速度比 LoRA 微调模型快 4 倍以上,证明了其在结构感知代码理解方面的有效性和高效性。
引用
@article{arxiv.2512.07666,
title = {Bridging Code Graphs and Large Language Models for Better Code Understanding},
author = {Zeqi Chen and Zhaoyang Chu and Yi Gui and Feng Guo and Yao Wan and Chuan Shi},
journal= {arXiv preprint arXiv:2512.07666},
year = {2025}
}