中文

通过子样本退火扩展非参数贝叶斯推断

机器学习 2019-10-25 v1 统计计算

摘要

我们描述了一种将模拟退火算法适配于非参数聚类及相关概率模型的方法。这种新算法在不断增长且持续更替的训练数据子样本上学习非参数潜在结构,其中子采样数据的比例可解释为退火计划中的逆温度 β(t)\beta(t)。高温下的吉布斯采样(即使用非常小的子样本)可以通过 (a) 在潜在空间中进行更长的跳跃(如同块吉布斯采样)和 (b) 降低能垒(如同模拟退火)来更快地探索最终潜在状态的草图。我们证明了子样本退火在一个简单的聚类模型中将混合时间从 N2N^2 加速到 NN,在另一类模型中从 exp(N)\exp(N) 加速到 NN,其中 NN 是数据大小。经验表明,子样本退火在单位时钟时间的准确性方面优于朴素吉布斯采样,并且可以扩展到更大的数据集和更深的层次模型。我们使用 Cross Categorization 模型的 Pitman-Yor 推广,展示了对美国人口普查数据和网络日志数据的百万行子样本以及一个 307 行的医院评级数据集的改进推断。

关键词

引用

@article{arxiv.1402.5473,
  title  = {Scaling Nonparametric Bayesian Inference via Subsample-Annealing},
  author = {Fritz Obermeyer and Jonathan Glidden and Eric Jonas},
  journal= {arXiv preprint arXiv:1402.5473},
  year   = {2019}
}

备注

To appear in AISTATS 2014