中文

关于采样器的测试

数据结构与算法 2020-10-27 v1

摘要

给定一组条目 F\mathcal{F} 和权重函数 wt:F(0,1)\mathtt{wt}: \mathcal{F} \mapsto (0,1),采样问题旨在按条目的权重成比例地采样一个条目。采样是机器学习中的一个基本问题。具有形式化保证的采样计算复杂度令人望而生畏,导致设计者提出基于启发式的技术,而这些技术缺乏严格的定量分析来量化所生成分布的质量。这给设计一种测试方法来检验被测采样器是否按给定分布生成样本带来了挑战。直到最近,Chakraborty 和 Meel(2019)针对权重函数 wt\mathtt{wt} 为常数的特殊情况(即采样器应从 F\mathcal{F} 中均匀采样)设计了首个可扩展验证器 Barbarik1。然而,Barbarik1 中的技术无法处理一般权重函数。本文的主要贡献是对上述挑战的肯定回答:受 Barbarik1 启发但采用不同技术与分析,我们设计了 Barbarik2 算法,用于测试采样器生成的分布与任意目标分布的差距是 ε\varepsilon-接近还是 η\eta-远离。与需要数量正比于 F|\mathcal{F}| 的样本的黑盒采样技术不同,Barbarik2 仅需 O~(tilt(wt,φ)2/η(η6ε)3)\tilde{O}(tilt(\mathtt{wt},\varphi)^2/\eta(\eta - 6\varepsilon)^3) 个样本,其中 tilttilt 为两个满足赋值的权重的最大比值。Barbarik2 可处理任意权重函数。我们给出了 Barbarik2 的原型实现,并用其测试了三个最先进的采样器。

关键词

引用

@article{arxiv.2010.12918,
  title  = {On Testing of Samplers},
  author = {Kuldeep S. Meel and Yash Pote and Sourav Chakraborty},
  journal= {arXiv preprint arXiv:2010.12918},
  year   = {2020}
}