中文

基于几何感知的球面采样:用于文本到图像生成中的解耦多样性增强

计算机视觉与模式识别 2026-05-29 v2

摘要

尽管现代文本到图像(T2I)生成模型在语义对齐方面表现优异,但仍难以从给定提示词生成多样化的图像。本文通过几何视角来增强 T2I 的多样性。不同于依赖主要基于熵的引导来增加样本不相似性的大多数现有方法,我们引入 Geometry-Aware Spherical Sampling(GASS),通过显式控制与提示词相关和与提示词无关的两个来源的变异来增强多样性。具体而言,我们使用两个正交方向分解 CLIP 嵌入中的多样性度量:文本嵌入捕获与提示词相关的语义变异,而识别的正交方向捕获与提示词无关的变异(例如背景)。基于此分解,GASS 通过沿两个轴增加生成图像嵌入的几何投影扩散,并通过沿生成轨迹的扩展预测来指导 T2I 采样过程。我们的实验在不同的冻结 T2I 主干模型(U-Net 和 DiT,扩散和流)和基准测试上表明,解耦的多样性增强在最小影响图像保真度和语义对齐方面具有有效性。

关键词

引用

@article{arxiv.2602.17200,
  title  = {GASS: Geometry-Aware Spherical Sampling for Disentangled Diversity Enhancement in Text-to-Image Generation},
  author = {Ye Zhu and Kaleb S. Newman and Johannes F. Lutzeyer and Adriana Romero-Soriano and Michal Drozdzal and Olga Russakovsky},
  journal= {arXiv preprint arXiv:2602.17200},
  year   = {2026}
}

备注

ICML 2026 Camera-ready. Code available at https://github.com/L-YeZhu/GASS_T2I