FreeScale: 基于最小规模成本的序列推荐模型分布式训练
机器学习
2026-04-28 v1 人工智能
分布式、并行与集群计算
信息检索
摘要
现代工业深度学习推荐模型通常通过分析用户的顺序交互历史来提取用户偏好,随后基于这些派生的兴趣生成预测。数据特征的内在异质性常导致大规模训练期间计算资源严重低利用,主要由于由于严重 straggler 以及慢速阻塞通信造成的计算泡沫。本文引入 FreeScale,旨在 (1) 通过严格均衡输入样本来缓解 straggler 问题 (2) 通过重叠优先级嵌入通信与计算来最小化阻塞通信 (3) 通过通过 SM-Free 技术解决计算和通信重叠期间的 GPU 资源竞争。经验评估表明,FreeScale 在应用于运行于 256 个 H100 GPU 的真实工作负载时,实现了最高达 90.3% 的计算泡沫降低。
引用
@article{arxiv.2604.24073,
title = {FreeScale: Distributed Training for Sequence Recommendation Models with Minimal Scaling Cost},
author = {Chenhao Feng and Haoli Zhang and Shakhzod Ali-Zade and Yanli Zhao and Liang Luo and Jennifer Cao and Lisen Deng and Siqiao Chen and Chenyu Zhao and Tristan Rice and Daniel Johnson and Min Si and Tiantu Xu and Yi Zhang and Siqi Yan and Chuanhao Zhuge and Min Ni and Bi Xue and Qunshu Zhang and Shen Li},
journal= {arXiv preprint arXiv:2604.24073},
year = {2026}
}
备注
14 pages, 11 figures. Accepted to the 9th MLSys Conference, Bellevue, WA, USA, 2026