中文

基于 $\ell_0$ 的稀疏典型相关分析

机器学习 2021-06-09 v2 机器学习

摘要

典型相关分析(CCA)模型在研究两组变量之间的关联方面非常强大。被称为“典型变量”的典型相关表示在无监督学习中被广泛用于分析未标注的多模态配准数据集。尽管取得了成功,但如果任一模态中的变量数量超过样本数量,CCA 模型可能会失效(或过拟合)。此外,通常有相当一部分变量度量的是模态特有信息,因此移除它们有利于识别典型相关变量。在此,我们提出 0\ell_0-CCA,一种基于来自两个观测模态的变量稀疏子集学习相关表示的方法。稀疏性通过对输入变量乘以随机门(stochastic gates)获得,其参数与 CCA 权重通过 0\ell_0 正则化相关损失一同学习。我们进一步提出 0\ell_0-Deep CCA,通过使用深度网络建模相关表示来解决非线性稀疏 CCA 问题。我们使用多个合成和真实示例证明了该方法的有效性。最值得注意的是,通过门控掉无用输入变量,与其他基于线性、非线性和稀疏 CCA 的模型相比,我们的方法改进了提取的表示。

关键词

引用

@article{arxiv.2010.05620,
  title  = {$\ell_0$-based Sparse Canonical Correlation Analysis},
  author = {Ofir Lindenbaum and Moshe Salhov and Amir Averbuch and Yuval Kluger},
  journal= {arXiv preprint arXiv:2010.05620},
  year   = {2021}
}