通过高效协同开源采样实现不上传数据的训练外包
机器学习
2022-10-25 v1 计算机视觉与模式识别
分布式、并行与集群计算
摘要
随着深度学习蓬勃发展,对计算与数据资源的需求不断增长,将模型训练外包给强大的云服务器成为在低功耗、高性价比的终端设备上进行训练的一种有吸引力的替代方案。传统外包需要将设备数据上传至云服务器,但由于所收集数据往往具有敏感性以及通信带宽有限,这在许多实际应用中并不可行。为应对这些挑战,我们提出利用广泛可用的开源数据,即来自公共与异构来源(如互联网图像)收集的大规模数据集。我们开发了一种称为高效协同开源采样(Efficient Collaborative Open-source Sampling, ECOS)的新策略,从开源数据构建近端代理数据集用于云端训练,以替代客户端数据。ECOS 在云服务器上探查开源数据,通过通信与计算高效的采样过程感知客户端数据分布,该过程仅通信少量压缩的公共特征与客户端标量响应。大量实证研究表明,所提出的 ECOS 在各种学习场景中应用时有助提升自动化客户端标注、模型压缩与标签外包的质量。
引用
@article{arxiv.2210.12575,
title = {Outsourcing Training without Uploading Data via Efficient Collaborative Open-Source Sampling},
author = {Junyuan Hong and Lingjuan Lyu and Jiayu Zhou and Michael Spranger},
journal= {arXiv preprint arXiv:2210.12575},
year = {2022}
}
备注
Accepted to NeurIPS'22