中文

变分前缀调优:用于使用预训练语言模型的多样且准确的代码摘要生成

软件工程 2025-05-23 v1 人工智能 机器学习

摘要

近期的代码摘要生成进展利用了基于转换器的预训练模型,包括代码大语言模型(LLMC),以自动化和提高代码摘要的生成。然而,现有方法通常只关注为给定源代码生成单一高质量的摘要,忽略生成的摘要可能不足且需要备选选项的情况。在本文中,我们引入变分前缀调优(VPT),一种新方法,增强了预训练模型生成多样且准确摘要集合的能力,允许用户为给定源代码选择最合适的选项。我们的方法将条件变分自编码器(CVAE)框架作为模块组件集成到预训练模型中,使我们能够建模观察到的目标摘要分布,并对用于引导解码期间生成多样化输出的连续嵌入进行采样。重要的是,我们以参数高效的方式构建了该方法,消除了特别是使用LLMC时需要昂贵模型重新训练的需求。此外,我们采用双准则重排序方法,从生成的摘要集合中选择一个子集,优化所呈现选项的多样性和准确性。我们使用广泛使用的数据集和当前最先进的预训练代码摘要模型进行了大量实验评估,以展示我们方法的有效性及其在不同模型上的可适应性。

关键词

引用

@article{arxiv.2505.09062,
  title  = {Variational Prefix Tuning for Diverse and Accurate Code Summarization Using Pre-trained Language Models},
  author = {Junda Zhao and Yuliang Song and Eldan Cohen},
  journal= {arXiv preprint arXiv:2505.09062},
  year   = {2025}
}

备注

Accepted by the Journal of Systems and Software