一种显式局部与全局表示解耦框架及其在深度聚类与无监督目标检测中的应用
计算机视觉与模式识别
2020-02-25 v2 机器学习
图像与视频处理
摘要
视觉数据可在不同粒度层次上理解,其中全局特征对应语义级信息,局部特征对应纹理模式。本文提出一种称为 SPLIT 的框架,该框架允许我们在变分自编码器(VAE)框架内将局部与全局信息解耦为两组分离的潜变量。我们的框架通过对 VAE 增加生成假设来要求潜变量的一个子集生成一组辅助可观测数据,从而扩展 VAE。这一额外的生成假设使潜变量倾向于局部信息,并促使其他潜变量表示全局信息。我们考察了具有不同生成假设的三种不同 VAE 变体。我们表明该框架能在这类模型中有效解耦局部与全局信息,从而获得改进的表示,在聚类和无监督目标检测基准上表现更优。最后,我们建立了 SPLIT 与认知神经科学中关于人类视觉感知解耦的近期研究之间的联系。我们的实验代码位于 https://github.com/51616/split-vae 。
引用
@article{arxiv.2001.08957,
title = {An Explicit Local and Global Representation Disentanglement Framework with Applications in Deep Clustering and Unsupervised Object Detection},
author = {Rujikorn Charakorn and Yuttapong Thawornwattana and Sirawaj Itthipuripat and Nick Pawlowski and Poramate Manoonpong and Nat Dilokthanakul},
journal= {arXiv preprint arXiv:2001.08957},
year = {2020}
}
备注
13 pages and 9 figures