中文

VIVAT:通过信任缓解改进VAE训练

计算机视觉与模式识别 2025-12-02 v2 机器学习 多媒体

摘要

变分自编码器(VAEs)是生成式计算机视觉的基石,但其训练常因信任问题而受影响,导致重构和生成质量下降。本文提出VIVAT方法,通过系统性地缓解KL-VAE训练中常见的信任问题,而无需进行根本性的架构更改。我们对五类常见信任——颜色偏移、网格纹理、模糊、角落和水滴信任——进行了详细分类,并分析其根本原因。通过简单的修改,包括调整损失权重、填充策略以及集成空间条件归一化,我们展示了在VAE性能方面的显著提升。本方法在多个基准测试中实现了图像重构指标(PSNR和SSIM)的状态最佳结果,并通过更优的CLIP分数增强了文本到图像生成质量。通过保持KL-VAE框架简单性的同时解决其实际挑战,VIVAT为致力于优化VAE训练的研究者和实践者提供了可操作的见解。

关键词

引用

@article{arxiv.2506.07863,
  title  = {VIVAT: Virtuous Improving VAE Training through Artifact Mitigation},
  author = {Lev Novitskiy and Viacheslav Vasilev and Maria Kovaleva and Vladimir Arkhipkin and Denis Dimitrov},
  journal= {arXiv preprint arXiv:2506.07863},
  year   = {2025}
}