中文

面向通用无训练文本引导语义操控的方法

计算机视觉与模式识别 2025-07-02 v2

摘要

文本引导语义操控指的是对由源提示词生成的图像进行语义编辑,以匹配目标提示词,从而实现所需的语义变化(如添加、删除和风格迁移),同时保持与无关内容的一致性。随着扩散模型强大的生成能力,该任务显示出生成高保真视觉内容的潜力。然而,现有方法通常需要耗时的微调(效率低下),难以实现多种语义操控(可扩展性差),且缺乏对不同模态任务的支持(普适性有限)。在进一步调查后,我们发现扩散模型中噪声的几何性质与语义变化密切相关。基于此,我们提出了一种新型 GTF\textit{GTF} 方法,用于文本引导语义操控,其具有以下吸引人的特性:1) 通用性\textbf{通用性}:我们的 GTF\textit{GTF} 支持多种语义操控(如添加、删除和风格迁移),可无缝集成到基于扩散的方法中(即即插即用),跨不同模态(即模态无关);2) 无训练性\textbf{无训练性}GTF\textit{GTF} 通过控制噪声之间的几何关系即可生成高保真结果,无需调参或优化。我们的大量实验表明,该方法的有效性突出,凸显了其在语义操控领域推进前沿的潜力。

关键词

引用

@article{arxiv.2504.17269,
  title  = {Towards Generalized and Training-Free Text-Guided Semantic Manipulation},
  author = {Yu Hong and Xiao Cai and Pengpeng Zeng and Shuai Zhang and Jingkuan Song and Lianli Gao and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2504.17269},
  year   = {2025}
}

备注

Project Page: https://ayanami-yu.github.io/GTF-Project-Page/