改进表示自编码器的重建
计算机视觉与模式识别
2026-02-10 v1
摘要
近期工作利用视觉基础模型作为图像编码器来提升潜在扩散模型(LDM)的生成性能,因为其语义特征分布易于学习。然而,此类语义特征通常缺乏低级信息(如颜色和纹理),导致重建保真度下降,这已成为进一步扩展LDM的主要瓶颈。为解决这一局限,我们提出LV-RAE,一种表示自编码器,它用缺失的低级信息增强语义特征,从而在保持与语义分布高度对齐的同时实现高保真重建。我们进一步观察到,由此产生的高维、信息丰富的潜在表示使得解码器对潜在扰动敏感,在解码生成的潜在表示时导致严重伪影,进而降低生成质量。我们的分析表明,这种敏感性主要源于解码器沿数据流形外方向的过度响应。基于这些见解,我们提出微调解码器以增强其鲁棒性,并通过受控噪声注入平滑生成的潜在表示,从而提升生成质量。实验表明,LV-RAE在保持语义抽象的同时显著提高了重建保真度,并实现了强大的生成质量。我们的代码可在 https://github.com/modyu-liu/LVRAE 获取。
引用
@article{arxiv.2602.08620,
title = {Improving Reconstruction of Representation Autoencoder},
author = {Siyu Liu and Chujie Qin and Hubery Yin and Qixin Yan and Zheng-Peng Duan and Chen Li and Jing Lyu and Chun-Le Guo and Chongyi Li},
journal= {arXiv preprint arXiv:2602.08620},
year = {2026}
}