中文

样本压缩方案的化简

机器学习 2025-04-09 v3 机器学习

摘要

我们提出了关于多类分类、回归和对抗鲁棒学习场景下样本压缩方案的新型化简。假设我们拥有大小为 f(dVC)f(d_{\mathrm{VC}}) 的二进制样本压缩方案,其中 dVCd_{\mathrm{VC}} 为 VC 维。则得到以下结果:(1) 若该二进制压缩方案为多数投票或稳定压缩方案,则存在大小为 O(f(dG))O(f(d_{\mathrm{G}})) 的多类压缩方案,其中 dGd_{\mathrm{G}} 为图维。对于通用二进制压缩方案,我们得到大小为 O(f(dG)logY)O(f(d_{\mathrm{G}})\log|Y|) 的压缩方案,其中 YY 为标签空间。(2) 若该二进制压缩方案为多数投票或稳定压缩方案,则存在针对 [0,1][0,1] 值函数回归的 ϵ\epsilon -近似压缩方案,大小为 O(f(dP))O(f(d_{\mathrm{P}})),其中 dPd_{\mathrm{P}} 为伪维。对于通用二进制压缩方案,我们得到大小为 O(f(dP)log(1/ϵ))O(f(d_{\mathrm{P}})\log(1/\epsilon)) 的压缩方案。若样本压缩猜想成立——即任何具有有限 VC 维的二进制概念类均 admits 大小为 O(dVC)O(d_{\mathrm{VC}}) 的二进制压缩方案——则我们的结果将立即扩展至其他场景。我们也为对抗鲁棒学习建立了类似结果,并给出一个概念类示例:该类可鲁棒学习但无界压缩方案,表明独立于样本规模的可学习性与压缩性在二进制分类中不同(后者可实现 2O(dVC)2^{O(d_{\mathrm{VC}})} 大小的压缩)。

关键词

引用

@article{arxiv.2410.13012,
  title  = {Sample Compression Scheme Reductions},
  author = {Idan Attias and Steve Hanneke and Arvind Ramaswami},
  journal= {arXiv preprint arXiv:2410.13012},
  year   = {2025}
}