优化打包与洗牌策略以提升生成语言模型的性能
计算与语言
2024-08-20 v1
摘要
打包和洗牌 token 是训练自回归语言模型(LM)时防止过拟合和提高效率的常见做法。通常文档被拼接成最大序列长度(MSL)的片段,然后进行洗牌。然而,将原子大小(即每个数据片段的长度,伴随随机洗牌)设置为 MSL 可能导致上下文不连贯,因为来自不同文档的 token 被打包到同一片段中。另一种方法是利用填充(padding),另一种常见的数据打包策略,通过每个洗牌片段仅包含一个文档来避免上下文不连贯。为了优化两种打包策略(拼接 vs 填充),我们研究了洗牌的最优原子大小,并比较了它们的性能和效率。我们发现将原子大小与 MSL 匹配能使两种打包方法(拼接和填充)均实现最优性能,且填充在最终困惑度上低于拼接(即性能更高),代价是更多的训练步数和更低的计算效率。这一权衡为训练语言模型时打包方法的选择提供了参考。
引用
@article{arxiv.2408.09621,
title = {Refining Packing and Shuffling Strategies for Enhanced Performance in Generative Language Models},
author = {Yanbing Chen and Ruilin Wang and Zihao Yang and Lavender Yao Jiang and Eric Karl Oermann},
journal= {arXiv preprint arXiv:2408.09621},
year = {2024}
}
备注
11 pages (include appendix), 26 figures, submitted to ACL ARR Aug 2024