中文

SGD 可从优中挑选好渔民吗?关于自我选择偏差及其以内的局部收敛性

机器学习 2025-04-11 v1 数据结构与算法 机器学习 统计理论 统计理论

摘要

我们重新审视了估计具有自我选择偏差的 k 个线性回归器的问题,方法是使用最大选择准则,正如 Cherapanamjeri、Daskalakis、Ilyas 和 Zampetakis 所提出 [CDIZ23, STOC'23]。我们的主要结果是算法运行时间为 poly(d,k,1/ε)+kO(k)\operatorname{poly}(d,k,1/\varepsilon) + {k}^{O(k)},从而改进了 [CDIZ23] 和 [GM24, arXiv] 中算法的运行时间。我们通过提供自我选择的第一个局部收敛算法来实现这一点,从而解决了 [CDIZ23] 中的主要开放问题。为获得该算法,我们将自我选择归约为一个看似不相关的统计问题,称为细化。细化发生在一个人不观察样本的确切值,而只观察包含确切值的集合(样本空间的子集)时。从细化样本进行推断在 various 实际应用中由于人类和算法的四舍五入、仪器的有限精度以及多智能体系统中的滞后等情况下出现。我们直观地将自我选择归约为细化,依赖于自我选择问题的几何特征,从而使我们能够绕过前一种分析方法的局限性。为演示其适用性,我们为线性回归提供了一个局部收敛算法,另一种自我选择准则,与第二价拍卖数据相关。进一步,我们给出了给定来自凸分区的样本进行 coarse 高斯均值估计的第一个多项式时间局部收敛算法。此前,仅知道 Fotakis、Kalavasis、Kontonis 和 Tzamos [FKKT21, COLT'21] 的样本高效算法。

关键词

引用

@article{arxiv.2504.07133,
  title  = {Can SGD Select Good Fishermen? Local Convergence under Self-Selection Biases and Beyond},
  author = {Alkis Kalavasis and Anay Mehrotra and Felix Zhou},
  journal= {arXiv preprint arXiv:2504.07133},
  year   = {2025}
}