CodeShell技术报告
软件工程
2024-03-26 v1 人工智能
摘要
代码大语言模型标志着人工智能的关键突破。它们专门用于理解和生成编程语言,显著提高了编码开发工作流程的效率。在本技术报告中,我们介绍了CodeShell-Base,一个具有70亿参数和8K上下文长度的基础模型,在代码理解方面表现出卓越的能力。通过将分组查询注意力和旋转位置编码融入GPT-2,CodeShell-Base整合了StarCoder和CodeLlama的结构优点,形成了其独特的架构设计。然后我们精心构建了一个全面的数据预处理流程,包括相似数据去重、基于困惑度的数据过滤和基于模型的数据过滤。通过这个过程,我们从GitHub中筛选出了1000亿高质量预训练数据。得益于高质量数据,CodeShell-Base在仅训练5000亿tokens(5个epoch)后,在Humaneval上超越了CodeLlama。我们在多个语言数据集(包括Python、Java和C++)上进行了广泛实验,结果表明我们的模型在代码理解和生成方面具有强大的基础能力。
引用
@article{arxiv.2403.15747,
title = {CodeShell Technical Report},
author = {Rui Xie and Zhengran Zeng and Zhuohao Yu and Chang Gao and Shikun Zhang and Wei Ye},
journal= {arXiv preprint arXiv:2403.15747},
year = {2024}
}