中文

面向分布式机器学习的私有内积检索

信息论 2019-02-19 v1 math.IT

摘要

在本文中,我们认为在许多基本的机器学习算法中,包括用于分类的支持向量机(SVM)、用于降维的主成分分析(PCA)以及用于依赖估计的回归,我们需要数据样本的内积,而非数据样本本身。受上述观察启发,我们引入了面向分布式机器学习的私有内积检索问题,其中我们有一个系统,包含一些文件的数据库,这些文件在若干不串谋的服务器上复制。用户意图以最小通信负载检索数据文件内积中特定大小的子集,且不泄露所请求子集身份的任何信息。对于可达性,我们使用多消息私有信息检索(multi-message private information retrieval)的算法。对于逆界,我们证明当文件长度变大时,所有内积的集合收敛到具有均匀分布的独立随机变量,并推导收敛速率。为证明这一点,我们在不同长度的所有内积集合的序列间构造特殊依赖关系,其构成一个时间齐次不可约马尔可夫链,且不影响边缘分布。我们证明该马尔可夫链以均匀分布为其唯一平稳分布,其收敛速率由转移概率矩阵的第二大特征值主导。这使我们能够建立逆界,在文件大小变大时于某些情形下收敛到紧界。尽管该逆界基于多消息私有信息检索中的逆界,但由于检索内积而非数据本身的性质,为得到所需结果做了一些改动。

关键词

引用

@article{arxiv.1902.06319,
  title  = {Private Inner Product Retrieval for Distributed Machine Learning},
  author = {Mohammad Hossein Mousavi and Mohammad Ali Maddah-Ali and Mahtab Mirmohseni},
  journal= {arXiv preprint arXiv:1902.06319},
  year   = {2019}
}