文本嵌入插值对连续图像引导的不可思议效应
计算机视觉与模式识别
2026-03-19 v1
摘要
我们提出了一种无需训练的框架,实现对文本条件生成模型在测试时的连续可控图像编辑。与依赖额外训练或手动用户干预的先前方法不同,我们发现简单的在文本嵌入空间中进行引导即可产生平滑的编辑控制。给定目标概念(例如增强照片 realism 或更改面部表情),我们使用大型语言模型自动构建一小组去偏置对比提示对,据此计算文本编码器空间中的引导向量。我们直接将该向量添加到输入提示表示中,以控制生成关键词沿所需语义轴向。为实现连续控制,我们提出了弹性范围搜索程序,自动识别有效的引导幅度区间,避免过度引导(无编辑)或欠引导(改变其他属性)。在该区间内添加该向量的缩放版本可产生平滑且连续的编辑。由于该方法仅修改文本表示,因此自然地跨模态 generalization,包括图像和视频生成。为量化引导连续性,我们引入了新的评估指标,衡量编辑强度范围内语义变化的均匀性。我们比较了不同方法的连续编辑行为,尽管该方法简单轻量级,却与基于训练的替代方法相当,甚至优于其他无训练方法。
引用
@article{arxiv.2603.17998,
title = {The Unreasonable Effectiveness of Text Embedding Interpolation for Continuous Image Steering},
author = {Yigit Ekin and Yossi Gandelsman},
journal= {arXiv preprint arXiv:2603.17998},
year = {2026}
}
备注
Project Page: https://yigitekin.github.io/diffusion-sliders