CORAL:解耦长尾扩散模型中的潜在表征
机器学习
2025-12-02 v2
摘要
扩散模型在生成高质量且多样化的合成数据方面取得了显著的性能,但其成功通常假设类别平衡的训练分布。在现实场景中,多类别数据常遵循长尾分布,其中标准扩散模型会感到困扰——为尾部类别生成样本数量较少且质量较低。虽然这种降解已被记录,但其根本原因仍不明确。本文我们研究在长尾数据集上训练的扩散模型的行为,识别出关键问题:尾部类别子空间的潜在表征(来自 U-Net 瓶颈层)与头部类别的显著重叠,导致特征借用和生成质量差下。重要的是,我们表明这并仅仅是由于每个类别的数据有限,更关键的是,相对类别不平衡显著contributions to this phenomenon。为解决此问题,我们提出了 COntrastive Regularization for Aligning Latents (CORAL),一种基于监督对比损失鼓励潜在类别表征良好分离的对抗潜在对齐框架。实验表明,CORAL 在相对 SOTA 方法生成的尾部类别样本的多样性和视觉质量方面显著提升。
引用
@article{arxiv.2506.15933,
title = {CORAL: Disentangling Latent Representations in Long-Tailed Diffusion},
author = {Esther Rodriguez and Monica Welfert and Samuel McDowell and Nathan Stromberg and Julian Antolin Camarena and Lalitha Sankar},
journal= {arXiv preprint arXiv:2506.15933},
year = {2025}
}
备注
Accepted at NeurIPS 2025