中文

消除超效率诅咒:保序回归中分布式计算的有效策略

统计理论 2018-06-25 v1 统计理论

摘要

我们提出一种策略,用于在一般回归设定下计算单调函数的保序最小二乘估计,其中数据分布于不同服务器,且跨服务器的观测虽独立但可来自异质子总体,从而违背同分布假设。我们的策略修正了先前保序回归框架中分布式计算工作所观察到的超效率现象:在中央服务器上对若干保序估计(各在本地服务器计算)取平均会产生超有效估计,其不能复现全局保序估计量(即将所有数据传输至单一服务器所构造的保序估计)的性质。本文提出的新估计量通过对每个本地服务器上的数据进行平滑、将平滑摘要传送至中央服务器、再在中央服务器计算保序估计来工作,并被证明可复现全局估计量的渐近性质,且克服了早期估计量展现的超效率现象。对于含 NN 个观测的数据,新估计量只需跨服务器传输约 N1/3N^{1/3} 阶的数据[相较之下,计算全局保序估计量需传输 NN 阶数据],且所需计算时间与全局估计量同阶。

关键词

引用

@article{arxiv.1806.08542,
  title  = {Removing the Curse of Superefficiency: an Effective Strategy For Distributed Computing in Isotonic Regression},
  author = {Moulinath Banerjee and Cecile Durot},
  journal= {arXiv preprint arXiv:1806.08542},
  year   = {2018}
}

备注

38 pages