基于 $\beta$-VAE 蒸馏与扩散概率反馈的闭环无监督表示解耦
计算机视觉与模式识别
2025-09-10 v2 机器学习
摘要
表示解耦可能有助于 AI 从根本上理解真实世界,从而有益于判别与生成任务。目前它至少存在三个未解决的核心问题:(i) 严重依赖标签标注与合成数据——导致在自然场景下泛化能力差;(ii) 启发式/手工设计的解耦约束使得难以自适应地实现最优训练权衡;(iii) 缺乏合理的评估指标,特别是针对真实无标签数据。为了应对这些挑战,我们提出了一种闭环无监督表示解耦方法,称为 CL-Dis。具体而言,我们使用基于扩散的自编码器(Diff-AE)作为主干,同时借助 -VAE 作为副手来提取语义解耦的表示。扩散模型的强大生成能力与 VAE 模型的良好解耦能力互为补充。为了增强解耦,VAE 潜空间蒸馏与扩散反馈在一个闭环系统中相互连接,以进一步相互促进。然后,引入一种自监督的导航策略来识别解耦潜空间中可解释的语义方向。最后,设计了一种基于内容追踪的新指标来评估解耦效果。实验证明了 CL-Dis 在真实图像编辑与视觉分析等应用上的优越性。
引用
@article{arxiv.2402.02346,
title = {Closed-Loop Unsupervised Representation Disentanglement with $\beta$-VAE Distillation and Diffusion Probabilistic Feedback},
author = {Xin Jin and Bohan Li and BAAO Xie and Wenyao Zhang and Jinming Liu and Ziqiang Li and Tao Yang and Wenjun Zeng},
journal= {arXiv preprint arXiv:2402.02346},
year = {2025}
}
备注
ECCV 2024