将 Granite 代码模型扩展至 128K 上下文
人工智能
2024-07-19 v1 计算与语言
软件工程
摘要
本文介绍支持最高可达 128K token 上下文窗口的长上下文 Granite 代码模型。我们的方法通过逐渐增加其 RoPE 基频配合仓储级文件打包和长度上采样的长上下文数据进行轻量级持续预训练,将 Granite 3B/8B 代码模型的上下文长度从 2K/4K 扩展至 128K。此外,我们还发布了进一步在混合式短上下文和长上下文指令-响应对上进行微调的指令调优模型。与原始短上下文 Granite 代码模型相比,我们的长上下文模型在长上下文任务上实现了显著提升,同时在常规代码完成基准(如 HumanEval)上未出现显著性能下降。我们以 Apache 2.0 许可证发布所有长上下文 Granite 代码模型,供研究和商业用途使用。
引用
@article{arxiv.2407.13739,
title = {Scaling Granite Code Models to 128K Context},
author = {Matt Stallone and Vaibhav Saxena and Leonid Karlinsky and Bridget McGinn and Tim Bula and Mayank Mishra and Adriana Meza Soria and Gaoyuan Zhang and Aditya Prasad and Yikang Shen and Saptha Surendran and Shanmukha Guttula and Hima Patel and Parameswaran Selvam and Xuan-Hong Dang and Yan Koyfman and Atin Sood and Rogerio Feris and Nirmit Desai and David D. Cox and Ruchir Puri and Rameswar Panda},
journal= {arXiv preprint arXiv:2407.13739},
year = {2024}
}