中文

极小极大实验设计:弥合最小二乘回归中统计与最坏情形方法的鸿沟

机器学习 2019-02-05 v1 机器学习

摘要

在实验设计中,我们给定一大组向量,每个向量带有隐藏的响应值,我们假设其源自潜在的线性模型,并希望选取向量的一个小的子集,使得查询相应响应能得到模型的良好估计。统计学中的经典方法是假设响应为线性加上零均值独立同分布高斯噪声,此时目标是提供具有最小均方误差的无偏估计量(A-最优设计)。一个相关的、在计算机科学中更常见的方法是假设响应任意但固定,此时目标是在最坏情形输入下,用少量响应尽可能快地估计最小二乘解。尽管有许多尝试,刻画这两种方法之间的关系已被证明难以捉摸。我们通过提出一个响应由任意未知分布产生的实验设计框架来解决此问题。我们表明,在该一般模型下,存在一种高效的随机化实验设计过程,能用少量响应为无偏估计量提供强方差界。经典 A-最优性准则的近乎紧的界,以及针对最坏情形响应的改进界,均作为该结果的特例浮现。在此过程中,我们为称为体积采样(volume sampling)的联合采样分布开发了一种新算法,并提出了一种新的独立同分布重要性采样方法:逆得分采样(inverse score sampling)。我们分析的一个关键新颖之处在于,通过体积采样的联合性控制独立同分布采样的尾部行为,从而为最坏情形回归建立新的期望误差界。我们的结果催生了一种新的实验设计极小极大最优性准则,可视为 A-最优设计与最坏情形回归采样的推广。

关键词

引用

@article{arxiv.1902.00995,
  title  = {Minimax experimental design: Bridging the gap between statistical and worst-case approaches to least squares regression},
  author = {Michał Dereziński and Kenneth L. Clarkson and Michael W. Mahoney and Manfred K. Warmuth},
  journal= {arXiv preprint arXiv:1902.00995},
  year   = {2019}
}