中文

潜在分区网络:面向生成建模、表征学习与分类的统一原理

机器学习 2025-11-05 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

生成建模、表征学习和分类是机器学习中的三个核心问题,但其最先进(SOTA)解决方案仍大体上是相互独立的。本文提出:能否通过统一原理来解决上述三者?这种统一性或可简化机器学习管道,促进跨任务的更大协同。我们引入潜在分区网络(Latent Zoning Network, LZN)作为迈向此目标的一步。核心在于,LZN 创建一个共享的高斯潜在空间,对所有任务进行信息编码。每种数据类型(如图像、文本、标签)都配备一个编码器,将样本映射到互不重叠的潜在区域,并配备一个解码器,将潜在变量映射回数据。机器学习任务表示为这些编码器和解码器的组合:例如,标签条件图像生成使用标签编码器和图像解码器;图像嵌入使用图像编码器;分类使用图像编码器和标签解码器。我们在三个日益复杂的场景中展示了 LZN 的前景:(1) LZN 可增强现有模型(图像生成):当与 SOTA Rectified Flow 模型结合时,LZN 在 CIFAR10 上的 FID 从 2.76 提升至 2.59,无需修改训练目标。(2) LZN 可独立解决任务(表征学习):LZN 可在无辅助损失函数的情况下实现无监督表征学习,在 ImageNet 上下游线性分类中超越关键 MoCo 和 SimCLR 方法,分别提升 9.3% 和 0.2%。(3) LZN 可同时解决多个任务(联合生成与分类):通过图像和标签编码器/解码器,LZN 按设计方式同时完成这两个任务,提升 FID 并在 CIFAR10 上实现 SOTA 分类准确率。代码和训练好的模型已提供:https://github.com/microsoft/latent-zoning-networks。项目网站在 https://zinanlin.me/blogs/latent_zoning_networks.html。

关键词

引用

@article{arxiv.2509.15591,
  title  = {Latent Zoning Network: A Unified Principle for Generative Modeling, Representation Learning, and Classification},
  author = {Zinan Lin and Enshu Liu and Xuefei Ning and Junyi Zhu and Wenyu Wang and Sergey Yekhanin},
  journal= {arXiv preprint arXiv:2509.15591},
  year   = {2025}
}

备注

Published in NeurIPS 2025