中文

具有本征维数约束的自编码器用于学习低维图像表示

计算机视觉与模式识别 2023-04-18 v1

摘要

自编码器在各种计算机视觉应用中取得了巨大成功。自编码器通过自监督范式(即重构)学习合适的低维图像表示。现有研究主要关注最小化图像像素级重构误差,而忽略了本征维数(ID)的保持,ID 是深度神经网络(DNNs)中数据表示的基本几何性质。受 ID 重要作用的启发,本文提出一种新颖的带自编码器的深度表示学习方法,将全局与局部 ID 约束的正则化融入数据表示的重构中。该方法不仅保持了整个数据集的全局流形结构,也维持了每个点特征图的局部流形结构,使学到的低维特征更具判别性并提升下游算法性能。据我们所知,现有工作在自编码器正则化中同时利用全局与局部 ID 不变性质方面稀少且有限。在基准数据集(Extended Yale B、Caltech101 和 ImageNet)上的数值实验结果表明,所得正则化学习模型为包括图像分类与聚类的下游任务获得了更好的判别表示。

关键词

引用

@article{arxiv.2304.07686,
  title  = {Autoencoders with Intrinsic Dimension Constraints for Learning Low Dimensional Image Representations},
  author = {Jianzhang Zheng and Hao Shen and Jian Yang and Xuan Tang and Mingsong Chen and Hui Yu and Jielong Guo and Xian Wei},
  journal= {arXiv preprint arXiv:2304.07686},
  year   = {2023}
}