中文

深度多模态子空间聚类网络

机器学习 2025-10-13 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

我们提出基于卷积神经网络(CNN)的无监督多模态子空间聚类方法。所提框架由三个主要阶段组成——多模态编码器、自表达层与多模态解码器。编码器以多模态数据为输入并将其融合为潜空间表示。自表达层负责强制自表达性质并获取对应于数据点的亲和矩阵。解码器重建原始输入数据。网络在训练中利用解码器重建与原始输入之间的距离。我们研究早期、晚期与中间融合技术,并针对空间融合提出三种对应的编码器。自表达层与多模态解码器对不同基于空间融合的方法基本是相同的。除各种基于空间融合的方法外,还提出了一种基于亲和融合的网络,其中对应于不同模态的自表达层被强制为相同。在三个数据集上的大量实验表明,所提方法显著优于最先进的多模态子空间聚类方法。

关键词

引用

@article{arxiv.1804.06498,
  title  = {Deep Multimodal Subspace Clustering Networks},
  author = {Mahdi Abavisani and Vishal M. Patel},
  journal= {arXiv preprint arXiv:1804.06498},
  year   = {2025}
}