中文

基于图表自编码器的内在数据结构深度非参数估计:泛化误差与鲁棒性

机器学习 2023-10-26 v3 机器学习

摘要

自编码器在各种应用中学习高维数据的低维潜在特征方面已取得显著成功。假设数据采样于低维流形附近,我们采用图表自编码器,将数据编码为一组图表上的低维潜在特征,保留数据流形的拓扑与几何结构。本文建立了图表自编码器泛化误差的统计保证,并通过考虑在 dd 维流形上的 nn 个含噪训练样本及其无噪对应样本,展示了其去噪能力。通过训练自编码器,我们表明图表自编码器能有效去除含正态噪声输入数据的噪声。我们证明,在适当的网络架构下,图表自编码器实现的 squared 泛化误差量级为 n2d+2log4n\displaystyle n^{-\frac{2}{d+2}}\log^4 n,其依赖于流形的内禀维度,且仅弱依赖于 ambient 维度与噪声水平。我们进一步将理论扩展至同时含正态与切向分量噪声的数据,其中图表自编码器对正态分量仍展现去噪效果。作为特例,只要数据流形具有全局参数化,我们的理论亦适用于经典自编码器。我们的结果为自编码器的有效性提供了坚实的理论基础,并通过若干数值实验进一步验证。

关键词

引用

@article{arxiv.2303.09863,
  title  = {Deep Nonparametric Estimation of Intrinsic Data Structures by Chart Autoencoders: Generalization Error and Robustness},
  author = {Hao Liu and Alex Havrilla and Rongjie Lai and Wenjing Liao},
  journal= {arXiv preprint arXiv:2303.09863},
  year   = {2023}
}