中文

FALCON:反馈驱动的自适应长短期记忆强化编码优化系统

机器学习 2025-06-23 v5 人工智能 性能

摘要

近年来,大语言模型(LLMs)在自动化代码生成方面取得了显著进展。尽管它们具有强大的指令遵循能力,但这些模型在编码场景中常常难以与用户意图对齐。特别是,它们受到缺乏多样性且未能解决专门任务或边缘情况的数据集的阻碍。此外,监督微调(SFT)和基于人类反馈的强化学习(RLHF)方面的挑战导致其无法生成精确且符合人类意图的代码。为解决这些挑战并提升自动化编程系统的代码生成性能,我们提出了反馈驱动的自适应长短期记忆强化编码优化系统(即 FALCON)。FALCON 结构分为两个层级。在全局层面,长期记忆通过保留和应用已学知识来提高代码质量。在局部层面,短期记忆允许整合来自编译器和 AI 系统的即时反馈。此外,我们引入了带有反馈奖励的元强化学习,以解决全局-局部双层优化问题,并增强模型在不同代码生成任务中的适应性。大量实验表明,我们的技术达到了最先进的性能,在 MBPP 基准上领先其他强化学习方法超过 4.5 个百分点,在 Humaneval 基准上领先 6.1 个百分点。开源代码可在 https://github.com/titurte/FALCON 公开获取。

关键词

引用

@article{arxiv.2410.21349,
  title  = {FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system},
  author = {Zeyuan Li and Yangfan He and Lewei He and Jianhui Wang and Tianyu Shi and Bin Lei and Yuchen Li and Qiuwu Chen},
  journal= {arXiv preprint arXiv:2410.21349},
  year   = {2025}
}

备注

20 pages, 7 figures