分布式参数 Map-Reduce
分布式、并行与集群计算
2015-10-06 v1 机器学习
机器学习
摘要
本文描述了如何将机器学习问题转化为一系列map-reduce任务。我们研究逻辑回归算法。在逻辑回归算法中,假设样本独立且每个样本被赋予一个概率。参数通过最大化所有样本概率的乘积获得。训练样本的快速增长给机器学习方法带来挑战。训练样本数量巨大,只能存储在分布式文件系统中并由map-reduce风格的程序驱动。逻辑回归的主要步骤是推断。根据map-reduce精神,每个样本通过单独的map过程进行推断。但推断的前提是该map过程持有样本中全部特征对应的参数。本文中,我们提出分布式参数Map-Reduce(Distributed Parameter Map-Reduce),其中不仅样本,参数也分布在分布式文件系统的节点中。通过一系列map-reduce任务,我们为每个样本分配其特征对应的参数,对该样本进行推断并更新模型参数。上述过程循环执行直至收敛。我们在实际hadoop生产环境中测试了所提算法。实验表明该算法的加速比与集群节点数呈线性关系。
引用
@article{arxiv.1510.00817,
title = {Distributed Parameter Map-Reduce},
author = {Qi Li},
journal= {arXiv preprint arXiv:1510.00817},
year = {2015}
}