超级微型语言模型
计算与语言
2024-06-27 v2 人工智能
摘要
大型语言模型(LLMs)的快速发展显著提升了自然语言处理的能力,但也因其高昂的计算和能源需求带来了挑战。本文介绍了一系列聚焦于超级微型语言模型(STLMs)的研究工作,旨在以大幅减少的参数数量实现高性能。我们探索了创新技术,如带有池化机制的字节级分词、权重绑定以及高效训练策略。这些方法旨在相比传统模型显著减少参数数量——在未来的工作中,我们计划在此基础上以保持并提升基础Transformer模型性能的方式继续推进。本系列论文将探讨各种子问题,包括无分词器模型、基于自对弈的训练以及替代训练目标。我们将针对1000万、5000万和1亿参数的模型展开研究。我们的最终目标是使高性能语言模型更易于获取并适用于广泛的应用场景。
引用
@article{arxiv.2405.14159,
title = {Super Tiny Language Models},
author = {Dylan Hillier and Leon Guertler and Cheston Tan and Palaash Agrawal and Chen Ruirui and Bobby Cheng},
journal= {arXiv preprint arXiv:2405.14159},
year = {2024}
}
备注
11 pages, 4 figures