每个样本都很重要:利用混合专家模型与高质量数据构建高效精准的代码大语言模型
机器学习
2025-03-25 v1 人工智能
计算与语言
摘要
近期代码大语言模型(code LLM)的进展显示出在代码生成与理解方面具有卓越的能力。然而,在构建综合性能优异且最终又具备高效性的代码 LLM 方面仍面临挑战。开源社区已有许多尝试旨在解决性能与效率之间的权衡问题,如 Qwen Coder 系列和 DeepSeek Coder 系列。本文提出了另一种尝试,称为 Ling-Coder-Lite。我们运用高效的混合专家(Mixture-of-Experts, MoE)架构,结合一系列高质量数据 curated 方法(尤其是基于程序分析的方法),构建出既高效又强大的代码 LLM。Ling-Coder-Lite 在 12 个代表性编码基准测试中表现与 Qwen2.5-Coder-7B 和 DeepSeek-Coder-V2-Lite 等同类规模的前沿模型持平,同时具备具竞争力的延迟和吞吐量。实际应用中,我们实现了与同规模稠密模型相比,部署资源减少 50%,且不损失性能。为促进该领域的进一步研究与开发,我们开源了模型及其部分高质量数据,用于 annealing 与 post-training 阶段。模型与数据可访问于~\url{https://huggingface.co/inclusionAI/Ling-Coder-lite}。
引用
@article{arxiv.2503.17793,
title = {Every Sample Matters: Leveraging Mixture-of-Experts and High-Quality Data for Efficient and Accurate Code LLM},
author = {Codefuse and Ling Team and : and Wenting Cai and Yuchen Cao and Chaoyu Chen and Chen Chen and Siba Chen and Qing Cui and Peng Di and Junpeng Fang and Zi Gong and Ting Guo and Zhengyu He and Yang Huang and Cong Li and Jianguo Li and Zheng Li and Shijie Lian and BingChang Liu and Songshan Luo and Shuo Mao and Min Shen and Jian Wu and Jiaolong Yang and Wenjie Yang and Tong Ye and Hang Yu and Wei Zhang and Zhenduo Zhang and Hailin Zhao and Xunjin Zheng and Jun Zhou},
journal= {arXiv preprint arXiv:2503.17793},
year = {2025}
}
备注
20 pages, 6 figures