从互信息视角看用于正视图生成的多潜变量生成模型
计算机视觉与模式识别
2026-01-01 v2
摘要
在图像生成中,多潜变量生成模型 (MLVGMs) 使用多个潜变量逐步塑造最终图像,从全局特征到更精细的局部细节(例如 StyleGAN、NVAE),已成为多种应用中的强大工具。然而,其生成动力学仍仅凭经验观察,缺乏对每个潜变量影响的系统性理解。在这项工作中,我们提出了一个新颖的框架,使用互信息 (MI) 作为度量来量化每个潜变量的贡献。我们的分析揭示,当前的 MLVGMs 常常未充分利用某些潜变量,并为其在下游应用中的使用提供了可操作的见解。在此基础上,我们引入了一种为自监督对比表示学习 (SSCRL) 生成合成数据的方法。通过利用 MLVGMs 的分层和解耦变量,我们的方法无需真实图像数据即可产生多样且语义上有意义的视图。此外,我们引入了一种连续采样 (CS) 策略,其中生成器在 SSCRL 训练期间动态创建新样本,极大地增加了数据变异性。我们全面的实验证明了这些贡献的有效性,表明 MLVGMs 生成的视图可与真实数据生成的视图相媲美甚至超越。这项工作建立了一种理解和利用 MLVGMs 的原则性方法,推动了生成建模和自监督学习的发展。代码和预训练模型位于:https://github.com/SerezD/mi_ml_gen。
引用
@article{arxiv.2501.13718,
title = {A Mutual Information Perspective on Multiple Latent Variable Generative Models for Positive View Generation},
author = {Dario Serez and Marco Cristani and Alessio Del Bue and Vittorio Murino and Pietro Morerio},
journal= {arXiv preprint arXiv:2501.13718},
year = {2026}
}