字节潜在变换器:补丁的规模优于标记
计算与语言
2024-12-16 v1
摘要
我们提出了 Byte Latent Transformer(BLT),一种新的字节级大语言模型架构,首次在规模化水平上能够与基于分词的大语言模型相当,并在推理效率和鲁棒性方面实现显著改进。BLT 将字节编码为动态大小的补丁,这些补丁作为计算的主要单元。基于下一个字节的熵对补丁进行分段,为数据复杂度增加的地方分配更多计算资源和模型容量。我们展示了首个受控规模研究的字节级模型,最高可达 80 亿参数和 4 万亿训练字节。我们的结果表明,在无固定词汇表的情况下扩缩训练的大型模型是可行的。由于在数据可预测时动态选择长补丁,训练和推理效率得以提高,并在推理成本固定的情况下,BLT 在规模化方面显著优于基于分词的模型,同时同时增大补丁和模型规模。
引用
@article{arxiv.2412.09871,
title = {Byte Latent Transformer: Patches Scale Better Than Tokens},
author = {Artidoro Pagnoni and Ram Pasunuru and Pedro Rodriguez and John Nguyen and Benjamin Muller and Margaret Li and Chunting Zhou and Lili Yu and Jason Weston and Luke Zettlemoyer and Gargi Ghosh and Mike Lewis and Ari Holtzman and Srinivasan Iyer},
journal= {arXiv preprint arXiv:2412.09871},
year = {2024}
}