中文

通过重构邻域进行表示学习

机器学习 2018-11-07 v2 人工智能 机器学习

摘要

自引入以来,无监督表示学习引起了研究界的广泛关注,因其在降维、聚类、可视化、信息检索和半监督学习等任务中被证明高效且易用。本文提出一种称为邻域编码器(neighbor-encoder)的新型无监督表示学习框架,其中领域知识可轻松融入学习过程,而无需修改经典自编码器的通用编码器-解码器架构。与重构输入数据本身的自编码器不同,邻域编码器重构输入数据的邻域。由于所提表示学习问题本质上是一个邻域重构问题,领域知识可通过对象间相似性的适当定义轻松融入。基于该观察,我们的框架可利用任何现成的相似度搜索算法或侧信息来寻找输入对象的邻域。在其他算法(如关联规则挖掘)在适当邻域定义可随上下文变化的前提下,也可应用于我们的框架。我们在图像、文本和时间序列等多种不同领域,以及分类、聚类和可视化等多种数据挖掘任务中证明了框架的有效性。实验结果表明,邻域编码器不仅在我们考虑的大多数场景中优于自编码器,而且在文本文档聚类上达到了最先进(SOTA)性能。

关键词

引用

@article{arxiv.1811.01557,
  title  = {Representation Learning by Reconstructing Neighborhoods},
  author = {Chin-Chia Michael Yeh and Yan Zhu and Evangelos E. Papalexakis and Abdullah Mueen and Eamonn Keogh},
  journal= {arXiv preprint arXiv:1811.01557},
  year   = {2018}
}