面向边缘机器学习的通信高效 k-Means 算法
机器学习
2022-01-25 v2
摘要
我们考虑在基于边缘的机器学习背景下,为大型高维数据集计算 k-means 中心的问题,其中数据源将机器学习计算卸载到附近的边缘服务器。k-Means 计算是许多数据分析的基础,而通过利用边缘服务器的计算能力,以较低的计算与通信成本让数据源获得可证明准确的 k-means 中心,将极大提升这些分析的性能。我们提出让数据源发送由联合降维(DR)、基数缩减(CR)和量化(QT)生成的小型摘要,以在降低复杂度和通信成本的情况下支持近似 k-means 计算。通过分析基于精心设计的 DR/CR/QT 方法组合的 k-means 算法的复杂度、通信成本和近似误差,我们表明:(i)可以以近线性复杂度和常数或对数通信成本计算近最优的 k-means 中心;(ii)应用 DR 和 CR 的顺序显著影响复杂度和通信成本;(iii)将 DR/CR 方法与适当配置的量化器结合,可在不损害其他性能指标的情况下进一步降低通信成本。我们的理论分析已通过基于真实数据集的实验得到验证。
引用
@article{arxiv.2102.04282,
title = {Communication-efficient k-Means for Edge-based Machine Learning},
author = {Hanlin Lu and Ting He and Shiqiang Wang and Changchang Liu and Mehrdad Mahdavi and Vijaykrishnan Narayanan and Kevin S. Chan and Stephen Pasteris},
journal= {arXiv preprint arXiv:2102.04282},
year = {2022}
}