ParaDySe:面向 Transformer 中动态序列长度的并行策略切换框架
机器学习
2025-11-18 v1 人工智能
摘要
具有可变长度的动态序列在 Transformer-based 大语言模型(LLM)训练中被广泛使用。然而,当前的训练框架为这些序列采用预定义的静态并行策略,导致短序列无法实现通信-并行化消除,长序列则出现内存不足问题。为缓解此问题,我们提出 ParaDySe,这是一个面向动态序列的自适应并行策略切换框架。ParaDySe 根据输入序列的即时情况实现最优策略的即时采纳。它首先实现了具有统一张量布局规范的并行策略模块化函数库,然后构建基于混合方法的序列感知内存和时间成本模型。借助成本模型,ParaDySe 通过一种高效的启发式算法为动态序列选择分层最优策略。通过将这些技术集成在一起,ParaDySe 通过其设计良好的函数库实现了最优策略的无缝热切换。我们在序列长度最长达 624K 的数据集上将 ParaDySe 与基线方法进行比较。实验结果表明,ParaDySe 通过系统性地将长序列优化与现有框架集成,解决了 LLM 训练中的内存溢出(OOM)和通信-并行化瓶颈问题。
引用
@article{arxiv.2511.13198,
title = {ParaDySe: A Parallel-Strategy Switching Framework for Dynamic Sequence Lengths in Transformer},
author = {Zhixin Ou and Peng Liang and Jianchen Han and Baihui Liu and Linbo Qiao},
journal= {arXiv preprint arXiv:2511.13198},
year = {2025}
}