中文

VQGAN 中的矢量量化损失分析:面向图像到图像合成的单 GPU 消融研究

计算机视觉与模式识别 2023-08-11 v1 人工智能

摘要

本研究对矢量量化生成对抗网络(VQGANs)进行消融分析,聚焦于利用单块 NVIDIA A100 GPU 的图像到图像合成。当前工作在资源受限的条件下,探究了若干关键参数(包括训练轮数、图像数量、码本向量属性与潜变量维度)的细微影响。值得注意的是,我们聚焦于矢量量化损失,保持其他超参数与损失分量(GAN 损失)固定。此举旨在深入理解离散潜空间,并探究改变其大小如何影响重建。尽管我们的结果未超越现有基准,但我们的发现显著阐明了 VQGAN 在较小数据集下的行为,尤其涉及伪影、码本大小优化以及与主成分分析(PCA)的对比分析。该研究还通过引入二维位置编码揭示了有前景的方向,显示出伪影的显著减少,以及对清晰度与过拟合之间平衡的洞见。

关键词

引用

@article{arxiv.2308.05242,
  title  = {Vector quantization loss analysis in VQGANs: a single-GPU ablation study for image-to-image synthesis},
  author = {Luv Verma and Varun Mohan},
  journal= {arXiv preprint arXiv:2308.05242},
  year   = {2023}
}

备注

16 pages, 18 figures