提升、解缠、定制:面向代码生成的稳健 System2-to-System1 管线
人工智能
2025-02-19 v1
摘要
大型语言模型(LLM)在各个领域展现出惊人的能力,尤其在 system 1 任务中表现突出,但其在 system 2 任务中问题解决机制的细微之处仍不够被充分探索。近期研究兴起,探索通过推理时间计算捕获 System 2 推理知识并将其压缩到 System 1 过程中的方法。在本文中,我们聚焦于代表性的 system 2 任务——代码生成,并识别出两个主要挑战:(1)复杂的隐藏推理过程;(2) 异构数据分布的异构性,使探索和训练稳健的 LLM 求解器变得复杂。为此,我们提出一种新型 BDC 框架,通过具备互动提升、解缠异构训练数据以适用于可组合 LoRA 专家,并通过基于输入的超网络获得针对每个数据实例的定制问题求解器,实现有效性、灵活性和稳健性。该框架通过多个LLM的相互验证和提升,集成到蒙特卡洛树搜索过程中,增强了以反思为基础的修剪和细化。此外,我们引入 DisenLora 算法,将异构数据聚类,以微调 LLM 形成可组合 LoRA 专家,使其能够通过输入感知超网络生成针对性问题求解器。本工作为推进LLM在复杂推理任务中的能力提供了基础,提供了一种新颖的 System2-to-System1 解决方案。
引用
@article{arxiv.2502.12492,
title = {Boost, Disentangle, and Customize: A Robust System2-to-System1 Pipeline for Code Generation},
author = {Kounianhua Du and Hanjing Wang and Jianxing Liu and Jizheng Chen and Xinyi Dai and Yasheng Wang and Ruiming Tang and Yong Yu and Jun Wang and Weinan Zhang},
journal= {arXiv preprint arXiv:2502.12492},
year = {2025}
}