中文

RPiAE:一种提升图像生成与编辑的表示轴向自编码器

计算机视觉与模式识别 2026-03-20 v1

摘要

扩散模型已成为图像生成与编辑的主流范式,潜空间扩散模型通过将去噪迁移到紧凑的潜空间实现效率和可扩展性。最近的尝试利用预训练视觉表示模型作为tokenizer先验,或通过对扩散特征与表示特征对齐,或直接将表示编码器作为冻结tokenizer重用。虽然这些方法可改善生成指标,但常因冻结编码器导致重构保真度受限,从而影响编辑质量,同时过高维的潜空间使扩散建模困难。为此,我们提出表示轴向自编码器(Representation-Pivoted AutoEncoder),一种基于表示的tokenizer,提升生成与编辑效果。我们引入表示轴向正则化(Representation-Pivot Regularization),一种训练策略,使初始化于表示的编码器可针对重构进行微调,同时保持预训练表示空间的语义结构,然后通过变分桥接将潜空间压缩至紧凑空间以利于扩散建模。我们采用目标解耦的阶段性训练策略,依次优化生成可行性与重构保真度目标。综合这些组件,构成一个保留强语义、重构保真且产生低复杂度扩散潜空间的tokenizer。实验表明,RPiAE在文本到图像生成和图像编辑方面优于其他视觉tokenizer,同时在表示基础tokenizer中实现最佳重构保真度。

关键词

引用

@article{arxiv.2603.19206,
  title  = {RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing},
  author = {Yue Gong and Hongyu Li and Shanyuan Liu and Bo Cheng and Yuhang Ma and Liebucha Wu and Xiaoyu Wu and Manyuan Zhang and Dawei Leng and Yuhui Yin and Lijun Zhang},
  journal= {arXiv preprint arXiv:2603.19206},
  year   = {2026}
}