中文

捕捉缺失细节:基于频率增强变分自编码器的图像重建

计算机视觉与模式识别 2023-11-07 v2 计算机科学与博弈论

摘要

流行的 VQ-VAE 模型通过学习的离散码本重建图像,但存在随着压缩率升高图像重建质量急剧下降的显著问题。一个主要原因是较高的压缩率导致反映像素空间细节的高频频谱上更多视觉信号的丢失。本文提出一种频率补偿模块(FCM)架构以捕获缺失的频率信息从而提升重建质量。FCM 可轻松嵌入 VQ-VAE 结构,我们将新模型称为频率增强 VAE(FA-VAE)。此外,引入动态频谱损失(DSL)以引导 FCM 在不同频率间动态平衡以实现最优重建。FA-VAE 进一步扩展到文本到图像合成任务,并提出交叉注意力自回归 Transformer(CAT)以获取文本中更精确的语义属性。在多个基准数据集上以不同压缩率进行了广泛的重建实验,结果表明所提 FA-VAE 相比 SOTA 方法能够更忠实地恢复细节。CAT 也展现出更好的图像-文本语义对齐所带来的改进生成质量。

关键词

引用

@article{arxiv.2305.02541,
  title  = {Catch Missing Details: Image Reconstruction with Frequency Augmented Variational Autoencoder},
  author = {Xinmiao Lin and Yikang Li and Jenhao Hsiao and Chiuman Ho and Yu Kong},
  journal= {arXiv preprint arXiv:2305.02541},
  year   = {2023}
}

备注

Accepted by CVPR 2023, code available at https://github.com/oppo-us-research/FA-VAE