AlphaVAE:基于Alpha感知表示学习的统一端到端RGBA图像重建与生成
计算机视觉与模式识别
2025-07-15 v1 人工智能
摘要
近期的潜在扩散模型在利用预训练VAE压缩和重构低计算成本下的像素数据方面取得了在RGB图像合成方面的显著成果。然而,RGBA图像(具有透明或分层内容)的生成仍基本未被探索,由于缺乏大规模基准数据集。本文提出了ALPHA,即第一个全面的RGBA基准,采用alpha混合到规范背景上以适应四通道图像的标准RGB指标。我们进一步引入ALPHAVAE,一个统一的端到端RGBA VAE,通过纳入专门的alpha通道来扩展预训练的RGB VAE。该模型采用组合目标进行训练,包括alpha混合像素重建、patch级别的保真度、感知一致性以及双KL发散约束,以确保RGB和alpha表示在潜在空间中的保真度。我们的RGBA VAE仅使用8K张图像训练(与先前方法的100万张图像相比),在重建方面相较于LayerDiffuse提升了4.9 dB的PSNR和3.2%的SSIM提升。它还能在微调后置于潜在扩散框架中实现优异的透明图像生成。我们的代码、数据和模型在 https://github.com/o0o0o00o0/AlphaVAE 上公开,以便可重复性。
引用
@article{arxiv.2507.09308,
title = {AlphaVAE: Unified End-to-End RGBA Image Reconstruction and Generation with Alpha-Aware Representation Learning},
author = {Zile Wang and Hao Yu and Jiabo Zhan and Chun Yuan},
journal= {arXiv preprint arXiv:2507.09308},
year = {2025}
}