中文

无需训练的扩散模型适配用于可变尺寸文本到图像合成

计算机视觉与模式识别 2023-10-27 v2 机器学习 图像与视频处理

摘要

扩散模型(DMs)近期因在文本到图像合成中取得最先进性能而受到关注。遵循深度学习的传统,DMs 在固定尺寸的图像上训练和评估。然而,用户需要具有特定尺寸和多种宽高比的各种图像。本文致力于适配文本到图像扩散模型以处理此类变化,同时保持视觉保真度。我们首先观察到,在合成过程中,低分辨率图像存在物体刻画不完整的问题,而高分辨率图像表现出重复无序的呈现。接下来,我们建立了一个统计关系,表明注意力熵随 token 数量变化,意味着模型按图像分辨率比例聚合空间信息。对我们观察结果的后续解释是:低分辨率下因空间信息有限导致物体刻画不完整,而高分辨率下因空间信息冗余产生重复无序的呈现。基于此视角,我们提出一个缩放因子以缓解注意力熵的变化并减轻所观察到的缺陷模式。大量实验结果验证了所提缩放因子的有效性,使模型获得更好的视觉效果、图像质量和文本对齐。值得注意的是,这些改进无需额外训练或微调技术即可实现。

关键词

引用

@article{arxiv.2306.08645,
  title  = {Training-free Diffusion Model Adaptation for Variable-Sized Text-to-Image Synthesis},
  author = {Zhiyu Jin and Xuli Shen and Bin Li and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2306.08645},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023. 23 pages, 13 figures