中文

基于自编码器的结构化数据压缩:非线性与深度的可证明优势

机器学习 2024-02-08 v1 信息论 math.IT 机器学习

摘要

自编码器是机器学习与有损数据压缩众多经验分支中的一种重要模型。然而,即便在浅层两层设置下,一些基础理论问题仍未得到解答。特别是,浅层自编码器在多大程度上能捕捉底层数据分布的结构?针对稀疏高斯数据的1比特压缩这一典型情况,我们证明梯度下降会收敛到一个完全忽略输入稀疏结构的解。也就是说,该算法的性能与压缩无稀疏性的高斯源时相同。对于一般数据分布,我们给出了梯度下降极小值点形状随数据稀疏度变化而发生相变现象的证据:在临界稀疏度水平以下,极小值点是一个均匀随机选取的旋转(正如压缩非稀疏数据时一样);在临界稀疏度以上,极小值点是恒等映射(至多重排)。最后,通过利用与近似消息传递算法的联系,我们展示了如何针对稀疏数据压缩改进高斯性能:在浅层架构中添加去噪函数已可证明地降低损失,而一个合适的多层解码器则能带来进一步的提升。我们在CIFAR-10和MNIST等图像数据集上验证了我们的发现。

关键词

引用

@article{arxiv.2402.05013,
  title  = {Compression of Structured Data with Autoencoders: Provable Benefit of Nonlinearities and Depth},
  author = {Kevin Kögler and Alexander Shevchenko and Hamed Hassani and Marco Mondelli},
  journal= {arXiv preprint arXiv:2402.05013},
  year   = {2024}
}