倾斜的秤车:重新审视可控扩散的自编码器权衡
计算机视觉与模式识别
2026-01-30 v1
摘要
在潜在扩散模型中,自编码器(AE)通常需要平衡两种能力:忠实于重建和生成友好的潜在空间(例如,低gFID)。在最近的ImageNet规模AE研究中,我们注意到一种系统性偏差倾向于生成性指标来处理这种权衡:重建指标越来越少被报告,基于ablation的AE选择常常偏好最佳gFID配置,即使重建保真度下降。我们理论分析了为何这种gFID主导的偏好在ImageNet生成中看似无害,却在扩展到可控扩散时变得风险:AE可能导致条件漂移,从而限制了可实现的条件对齐。与此同时,我们发现,重建保真度,特别是实例级措施,更能指示可控性。我们通过研究几种最近的ImageNet AE,实证验证了倾斜的自编码器评估对可控性的影响。使用反映可控生成任务的多维条件漂移评估方案,我们发现gFID仅在条件保持方面具有较弱的预测性,而重建导向的指标则明显更一致。ControlNet实验进一步确认,可控性跟随条件保持而非gFID。总体而言,我们的结果揭示了ImageNet中心AE评估与可扩展可控扩散要求之间的差距,为更可靠的基准测试和模型选择提供了实用指导。
引用
@article{arxiv.2601.21633,
title = {A Tilted Seesaw: Revisiting Autoencoder Trade-off for Controllable Diffusion},
author = {Pu Cao and Yiyang Ma and Feng Zhou and Xuedan Yin and Qing Song and Lu Yang},
journal= {arXiv preprint arXiv:2601.21633},
year = {2026}
}
备注
work in progress