中文

学习信息复杂度的直和结果

机器学习 2018-04-20 v1 信息论 math.IT 机器学习

摘要

PAC 学习一个 VC 维为 dd 的假设类需要多少比特的信息?我们遵循 Bassily 等人 (2018) 的数学设定,其中感兴趣的量是输入样本 SS 与学习算法 AA 输出的假设之间的互信息 I(S;A(S))\mathrm{I}(S;A(S))。我们引入了一类在域 X\mathcal{X} 上 VC 维为 dd 的函数类,对于任何一致且proper的算法(确定性或随机),其信息复杂度至少为 Ω(dloglogXd)\Omega\left(d\log \log \frac{|\mathcal{X}|}{d}\right) 比特。Bassily 等人针对 d=1d=1 的情形证明了一个类似(但在定量上较弱)的结果。上述结果实际上是我们所探索的一个更一般现象的特例。我们定义了给定函数类 H\mathcal{H} 的信息复杂度的概念。直观地说,它是 H\mathcal{H} 的算法为确保一致性和properness而必须保留的关于其输入的最少信息量。我们在此背景下证明了信息复杂度的直和结果;粗略地说,当组合多个类时,信息复杂度会相加。

关键词

引用

@article{arxiv.1804.05474,
  title  = {A Direct Sum Result for the Information Complexity of Learning},
  author = {Ido Nachum and Jonathan Shafer and Amir Yehudayoff},
  journal= {arXiv preprint arXiv:1804.05474},
  year   = {2018}
}