我们是否以错误的方式使用自编码器?
机器学习
2023-09-06 v1 人工智能
计算机视觉与模式识别
摘要
自编码器无疑是最受研究和使用的深度学习模型之一:其背后的思想是训练一个模型以重建相同的输入数据。这些模型的特殊性在于通过瓶颈压缩信息,创建所谓的潜空间(Latent Space)。自编码器通常用于降维、异常检测与特征提取。鉴于其高简洁性与强大能力,这些模型已被广泛研究并更新。例如:(i) 去噪自编码器,模型被训练为从带噪图像重建图像;(ii) 稀疏自编码器,瓶颈由损失函数中的正则项创建;(iii) 变分自编码器,潜空间用于生成新的连贯数据。在本文中,我们重新审视了欠完备自编码器的标准训练,在不使用损失函数中任何显式正则项的情况下修改潜空间形状。我们强制模型重建的不是输入中的同一观测,而是从同一类别分布中采样的另一个观测。我们还探索了在重建整个数据集中随机样本时潜空间的行为。
引用
@article{arxiv.2309.01532,
title = {Are We Using Autoencoders in a Wrong Way?},
author = {Gabriele Martino and Davide Moroni and Massimo Martinelli},
journal= {arXiv preprint arXiv:2309.01532},
year = {2023}
}