我们能比随机起点做得更好吗?数据外包的力量
机器学习
2022-05-18 v1 机器学习
摘要
许多组织拥有丰富的数据,但缺乏处理这些数据的计算能力。虽然它们可以将计算任务外包给其他设施,但在可共享的数据量上存在各种约束。很自然地要问,在这样的约束下,数据外包能实现什么。我们从机器学习的角度来探讨这个问题。当使用优化算法训练模型时,结果的质量往往严重依赖于算法的初始化点。随机起点是解决此问题最流行的方法之一,但它可能计算成本高昂,对于缺乏计算资源的组织来说不可行。基于三种不同场景,我们提出了基于模拟的算法,能够利用少量外包数据来相应地找到良好的初始点。在适当的正则性条件下,我们提供了理论保证,证明这些算法能以高概率找到良好的初始点。我们还进行了数值实验,证明我们的算法性能显著优于随机起点方法。
引用
@article{arxiv.2205.08098,
title = {Can We Do Better Than Random Start? The Power of Data Outsourcing},
author = {Yi Chen and Jing Dong and Xin T. Tong},
journal= {arXiv preprint arXiv:2205.08098},
year = {2022}
}
备注
22 pages, 5 figures