中文

利用 Flash Attention 进行打包以提升训练效率

机器学习 2024-09-04 v6 人工智能

摘要

在调优 LLM 模型时,常会通过添加特殊标记到较短的训练示例中,以匹配每个 batch 中最长序列的长度。虽然这确保了 batch 处理的一致性,但会因包含无关的填充标记而引入效率问题,浪费 GPU 资源。Hugging Face SFT trainer 一直提供使用打包将多个训练示例组合在一起的选项,以实现最大化的 GPU 资源利用率。然而,迄今为止,该选项没有为每个打包的训练示例提供proper的掩码处理。Hugging Face Transformers 4.44 版本已添加了此功能。我们分析了这一新特性,展示了不同打包变体的优势。

关键词

引用

@article{arxiv.2407.09105,
  title  = {Enhancing Training Efficiency Using Packing with Flash Attention},
  author = {Achintya Kundu and Rhui Dih Lee and Laura Wynter and Raghu Kiran Ganti and Mayank Mishra},
  journal= {arXiv preprint arXiv:2407.09105},
  year   = {2024}
}