大规模分布式距离度量学习
机器学习
2014-12-19 v1
摘要
在具有高特征维度的大规模机器学习与数据挖掘问题中,数据点之间的欧氏距离可能缺乏信息量,因此常需要距离度量学习(DML)来学习合适的相似性度量(利用辅助信息,例如标记为相似或不相似的数据对)。然而,现代大数据中的高维度与海量成对约束,可能导致 Xing 等人(2002)的原始 DML 形式化及其后续扩展面临难以承受的计算代价。本文提出一种用于 DML 的分布式算法,以及在参数服务器架构上的大规模实现。我们的方法基于 Xing 等人(2002)工作的可并行化重构,以及异步随机梯度下降优化过程。据我们所知,这是 DML 的首个分布式解决方案;我们展示,在一个具有 256 个 CPU 核心的系统上,我们的程序能够在 15 小时内完成一个包含 100 万数据点、2.2 万特征和 2 亿标记数据对的 DML 任务;并且学习到的度量在正确度量距离方面表现出极高的有效性。
引用
@article{arxiv.1412.5949,
title = {Large Scale Distributed Distance Metric Learning},
author = {Pengtao Xie and Eric Xing},
journal= {arXiv preprint arXiv:1412.5949},
year = {2014}
}