ChuXin:16亿参数技术报告
计算与语言
2024-05-09 v1
摘要
本报告中,我们介绍了ChuXin,这是一款规模为16亿参数的完全开源语言模型。与大多数仅开源模型权重和架构的工作不同,我们提供了训练模型所需的一切材料,包括训练数据、训练过程以及评估代码。我们的目标是赋能并强化开源研究社区,促进透明度,并在语言建模领域引发新一轮创新。此外,我们通过轻量级持续预训练将上下文长度扩展至100万token,并展示了强大的针灸般检索性能。两个模型的权重均可在Hugging Face上下载使用。
引用
@article{arxiv.2405.04828,
title = {ChuXin: 1.6B Technical Report},
author = {Xiaomin Zhuang and Yufan Jiang and Qiaozhi He and Zhihua Wu},
journal= {arXiv preprint arXiv:2405.04828},
year = {2024}
}
备注
Technical Report