自编码器用于非线性特征融合的实用教程:分类、模型、软件与指南
机器学习
2018-01-08 v1 神经与进化计算
摘要
许多现有的机器学习算法,无论监督还是无监督,都依赖于输入特征的质量以生成良好模型。这些变量的数量也很重要,因为性能往往随输入维数增加而下降,因此人们对使用能产生更紧凑且更高层次特征集的特征融合技术感兴趣。过去几十年中已开发出大量融合原始变量以生成新变量的方法。最基础的 ones 使用原始变量的线性组合,如PCA(主成分分析)和LDA(线性判别分析),而其他方法基于非线性组合寻找更低维的流形嵌入,如Isomap或LLE(局部线性嵌入)技术。近来,自编码器(AEs)作为流形学习的替代方案涌现,用于进行非线性特征融合。近来已提出数十种AE模型,各有其特定性质。尽管其中许多可通过融合原始变量生成降维特征集,也有专为其他应用设计的AEs。本文旨在为读者提供关于AE是什么、如何用于特征融合、涵盖广泛模型的分类体系以及其与经典技术关系的概览。此外,提供了一套关于如何为给定任务选择恰当AE的启发性指南,并讨论了可用软件工具。最后,两个案例研究分别用手写数字与乳腺癌数据集说明了AE的使用。
引用
@article{arxiv.1801.01586,
title = {A practical tutorial on autoencoders for nonlinear feature fusion: Taxonomy, models, software and guidelines},
author = {David Charte and Francisco Charte and Salvador García and María J. del Jesus and Francisco Herrera},
journal= {arXiv preprint arXiv:1801.01586},
year = {2018}
}