中文

从词元到行:以长期视角增强代码生成

计算与语言 2026-02-10 v4

摘要

大语言模型(LLM)的出现显著推动了代码生成任务的发展,引发了相关文献的激增。当前研究受到冗余生成结果以及倾向于在短期内过拟合局部模式的阻碍。尽管现有研究试图通过采用多词元预测策略来缓解该问题,但在选择适当的生成处理长度方面仍然关注有限。通过分析LLM生成过程中词元之间的注意力,可以观察到注意力分数的高峰值通常出现在行的末尾。这一见解表明,将每行代码视为基本处理单元并顺序生成是合理的。受此启发,我们提出了LSR-MCTS算法,该算法利用蒙特卡洛树搜索(MCTS)逐行确定代码并选择最优路径。此外,我们在每个节点集成了自精炼机制,以增强多样性并通过错误修正生成更高质量的程序。在三个公开编码基准上的大量实验和全面分析表明,我们的方法优于最先进的性能方法。

关键词

引用

@article{arxiv.2504.07433,
  title  = {From Token to Line: Enhancing Code Generation with a Long-Term Perspective},
  author = {Tingwei Lu and Yangning Li and Liyuan Wang and Binghuai Lin and Qingsong Lv and Zishan Xu and Hai-Tao Zheng and Yinghui Li and Hong-Gee Kim},
  journal= {arXiv preprint arXiv:2504.07433},
  year   = {2026}
}