中文

关于低温度下指数权重聚合的最优性

统计理论 2013-03-22 v1 统计理论

摘要

给定一个有限的函数类F,聚合问题在于构造一个风险尽可能接近该类中最佳元素风险的程序。一个经典程序(PAC-贝叶斯统计学习理论(2004)巴黎第六大学,统计学习理论与随机优化(2001)Springer,Ann. Statist. 28(2000)75-87)是指数权重聚合(AEW),定义为f~AEW=fFθ^(f)f,其中θ^(f)=exp((n/T)Rn(f))gFexp((n/T)Rn(g)),\tilde{f}^{\mathrm{AEW}}=\sum_{f\in F}\hat{\theta}(f)f,\qquad \text{其中} \hat{\theta}(f)=\frac{\exp(-({n}/{T})R_n(f))}{\sum_{g\in F}\exp(-({n}/{T})R_n(g))},其中T>0T>0称为温度参数,Rn()R_n(\cdot)是经验风险。在本文中,我们研究了在随机设计回归模型和低温度状态下AEW的最优性。我们证明了AEW的三个性质。首先,我们表明当Tc1T\leq c_1c1c_1是一个绝对正常数,即低温度状态)时,AEW在二次风险的期望意义下是一个次优的聚合程序,并且即使在高温下,它在概率意义下也是次优的。其次,我们表明随着字典基数的增长,AEW的行为可能会恶化,即在低温度状态下,它可能以高概率集中在字典中那些风险比字典中最佳函数风险至少大1/n1/\sqrt{n}量级的元素上。第三,我们证明如果假设字典满足一个几何条件(所谓的“Bernstein条件”),那么AEW在低温度状态下确实在大概率意义和期望意义下都是最优的。此外,在该假设下,复杂度项本质上是“几乎最小化者”集合基数的对数,而不是整个字典基数的对数。该结果对温度参数的小值成立,从而补充了高温下的类似结果。

关键词

引用

@article{arxiv.1303.5180,
  title  = {On the optimality of the aggregate with exponential weights for low temperatures},
  author = {Guillaume Lecué and Shahar Mendelson},
  journal= {arXiv preprint arXiv:1303.5180},
  year   = {2013}
}

备注

Published in at http://dx.doi.org/10.3150/11-BEJ408 the Bernoulli (http://isi.cbs.nl/bernoulli/) by the International Statistical Institute/Bernoulli Society (http://isi.cbs.nl/BS/bshome.htm)