中文

面向无引导 AR 视觉生成的条件对比对齐

计算机视觉与模式识别 2024-10-15 v1 机器学习 图像与视频处理

摘要

分类器自由引导(CFG)是增强视觉生成模型样本质量的关键技术。然而,在自回归(AR)多模态生成中,CFG 引入了语言和视觉内容之间的设计不一致,这与统一不同模态以进行视觉 AR 的设计理念相矛盾。受语言模型对齐方法的启发,我们提出了条件对比对齐(Condition Contrastive Alignment,CCA)以实现高性能的无引导 AR 视觉生成,并分析其与引导采样方法的理论联系。与改变采样过程以实现理想采样分布的引导方法不同,CCA 直接微调预训练模型以适应相同的分布目标。实验结果表明,CCA 只需一个 epoch 的微调(约等于预训练 epoch 的 1%)即可显著提升所有测试模型的无引导性能,达到有引导采样方法的水平。这大大减少了 AR 视觉生成中有引导采样的需求,并将采样成本减半。此外,通过调整训练参数,CCA 可以实现样本多样性与保真度之间的权衡,类似于 CFG。这在实验上确认了语言目标对齐与视觉目标引导方法之间的强烈理论联系,统一了此前独立的两个研究领域。代码和模型权重:https://github.com/thu-ml/CCA。

关键词

引用

@article{arxiv.2410.09347,
  title  = {Toward Guidance-Free AR Visual Generation via Condition Contrastive Alignment},
  author = {Huayu Chen and Hang Su and Peize Sun and Jun Zhu},
  journal= {arXiv preprint arXiv:2410.09347},
  year   = {2024}
}