基于不等错误保护的分发矩阵乘法掉队者缓解方法
信息论
2021-03-22 v2 分布式、并行与集群计算
math.IT
摘要
大规模机器学习与数据挖掘方法通常将计算分发至多个智能体以并行化处理。智能体处所需的计算时间受本地资源可用性影响,从而引发了“掉队者问题”,即计算结果被无响应智能体拖慢。针对该问题,可对矩阵子块进行线性编码以引入对掉队的弹性。参数服务器(PS)利用信道码将矩阵分发给各 worker 进行乘法计算,然后在给定截止时间前依据收到的计算结果生成所需矩阵乘法的近似结果。本文提出采用不等错误保护(UEP)码来缓解掉队者问题。各子块的保护等级依据其范数选定,因为范数较大的块对矩阵乘法结果影响更显著。我们从理论与数值评估两方面验证了所提方案的有效性。我们利用随机线性码推导了 UEP 性能的理论刻画,并与等错误保护情形进行比较。我们还将所提编码策略应用于深度神经网络(DNN)训练中的反向传播步骤计算,并研究了计算精度与所需时间之间的基本权衡。
引用
@article{arxiv.2011.02749,
title = {Straggler Mitigation through Unequal Error Protection for Distributed Matrix Multiplication},
author = {Busra Tegin and Eduin E. Hernandez and Stefano Rini and Tolga M. Duman},
journal= {arXiv preprint arXiv:2011.02749},
year = {2021}
}
备注
6 pages, 6 figures