探索面向空间对齐图像的置换不变离散表示学习
计算机视觉与模式识别
2026-04-03 v1 机器学习
摘要
向量量化方法(如 VQ-VAE、VQ-GAN)学习图像的离散神经表示,但这些表示本质上是位置依赖的:代码在空间上排列且与上下文紧密耦合,需依赖自回归或扩散模型在采样时建模其依赖关系。本文探讨了空间对齐数据离散表示是否必需位置信息。我们提出置换不变向量量化自编码器(PI-VQ),其中潜在代码被约束不携带位置信息。我们发现,这一约束鼓励代码捕获全局语义特征,使其在无需学习的先验条件下即可实现图像之间的直接插值。为解决置换不变表示的容量受限问题,本文引入匹配量化(matching quantization),一种基于最优二分匹配的数字量化算法,相对于朴素最近邻量化可提高有效瓶颈容量 。所学习代码的组合结构进一步支持插值式采样,使其能够在单次前向传播中合成新图像。我们在 CelebA、CelebA-HQ 和 FFHQ 上评估了 PI-VQ,获得了对合成图像的竞争性精度、密度和覆盖率指标。我们讨论了位置无关表示所固有的权衡,包括潜在代码的可分性和可解释性,指向众多未来工作方向。
引用
@article{arxiv.2604.01843,
title = {Investigating Permutation-Invariant Discrete Representation Learning for Spatially Aligned Images},
author = {Jamie S. J. Stirling and Noura Al-Moubayed and Hubert P. H. Shum},
journal= {arXiv preprint arXiv:2604.01843},
year = {2026}
}
备注
15 pages plus references; 5 figures; supplementary appended; accepted to ICPR 2026