中文

LGQ:用于可扩展且稳定图像标记的学习离散几何

计算与语言 2026-02-19 v1 人工智能

摘要

离散图像标记是可扩展视觉生成的关键瓶颈:标记器必须保持紧凑以有效利用潜在空间的先验,同时保留语义结构并有效利用离散容量。现有量化器面临权衡:向量量化标记器学习灵活的几何结构,但常常受制于偏置的直通优化、码本 underutilization 以及在大型词汇表下出现表示坍塌。结构标量或隐式标记器通过设计确保稳定、近乎完整的容量利用,但依赖固定的离散几何结构,在异构潜在统计分布下可能导致容量分配不够高效。我们提出 Learnable Geometric Quantization (LGQ),一种能端到端学习离散几何结构的图像标记器。LGQ 将硬最近邻查找替换为温度控制的软分配,实现完全可微分的训练,同时在推断时恢复硬分配。这些分配对应于各向同心高斯混合模型的后验责任,并最小化变分自由能目标,必然在低温极限下收敛至最近邻量化。LGQ 结合了标记层的峰度正则化与全局使用正则化,以鼓励置信且均衡的代码利用,无需强制网格。我们在受控 VQGAN 风格的骨干网络上进行 ImageNet 上的实验,覆盖多个词汇表大小,LGQ 实现了稳定的优化和均衡的利用。在 16K 码本大小下,LGQ 相对于 FSQ 改进 rFID 指数提升 11.88%,同时使用 49.96% 更少的活跃码;相对于 SimVQ 改进 rFID 6.06%,且有效表示率降低 49.45%,在显著减少活跃条目数的同时实现了可比的保真度。我们的 GitHub 仓库地址为:https://github.com/KurbanIntelligenceLab/LGQ

关键词

引用

@article{arxiv.2602.16085,
  title  = {Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMs},
  author = {Sean Trott and Samuel Taylor and Cameron Jones and James A. Michaelov and Pamela D. Rivière},
  journal= {arXiv preprint arXiv:2602.16085},
  year   = {2026}
}

备注

15 pages, 7 figures, submitted to conference