中文

从可辨识性视角理解基于潜在相关性的多视图学习与自监督学习

机器学习 2022-04-12 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

数据的多个视图,无论是自然获取的(如图像与音频)还是人工生成的(如向数据样本添加不同噪声),都已被证明有助于增强表示学习。自然视图通常由多视图分析工具处理,例如(深度)典型相关分析[(D)CCA],而人工视图常用于自监督学习(SSL)范式,例如BYOL和Barlow Twins。这两类方法常涉及学习神经特征提取器,使数据的嵌入表现出较高的跨视图相关性。尽管直观,但基于相关性的神经嵌入的有效性大多通过经验验证。本工作旨在从潜在分量辨识的角度理解基于潜在相关性最大化的深度多视图学习。我们采用一种直观的多视图数据生成模型,其中各视图是共享分量与私有分量的不同非线性混合。由于共享分量对视图/失真具有不变性,使用此类分量表示数据被认为能高效且鲁棒地揭示样本身份。在该模型下,潜在相关性最大化被证明可保证提取跨视图的共享分量(直至某些模糊性)。此外,进一步表明通过适当的正则化设计,可将各视图中的私有信息从共享信息中可证明地解耦。我们还给出了有限样本分析,这在此类非线性混合可辨识性研究中较为罕见。理论结果与新设计的正则化在一系列任务上进行了测试。

关键词

引用

@article{arxiv.2106.07115,
  title  = {Understanding Latent Correlation-Based Multiview Learning and Self-Supervision: An Identifiability Perspective},
  author = {Qi Lyu and Xiao Fu and Weiran Wang and Songtao Lu},
  journal= {arXiv preprint arXiv:2106.07115},
  year   = {2022}
}

备注

Accepted to ICLR 2022 Spotlight, 37 pages, 11 figures