VAGS:面向图像编辑与生成的速度自适应引导尺度
计算机视觉与模式识别
2026-05-18 v1 人工智能
摘要
无分类器引导(CFG)是控制文本语义对基于流的采样器影响强度的主要手段,但标准做法是在整个常微分方程轨迹上保持其尺度固定。这是一个根本性的不匹配:早期步骤以噪声为主,携带的语义信号微弱,而后期步骤则确定图像结构,需要更强的方向性承诺;更关键的是,任何引导强度的价值取决于引导速度是与模型当前动态一致还是与之相悖。我们提出速度自适应引导尺度(VAGS),这是一种免训练的替代方案,通过将有界因子乘以名义尺度来实现,该因子结合了时间信号水平项与任务相关速度场之间的余弦相似度。对于免反演编辑,VAGS测量源引导速度与目标引导速度之间的对齐程度,使得每一步的编辑强度反映保留与变换之间的局部兼容性。对于生成任务,VAGS-Gen使用无条件速度与条件速度之间的对齐作为类似信号。两种变体均无需微调、辅助网络或额外的前向传播,且固定CFG可作为特例恢复。在编辑任务的PIE-Bench和DIV2K数据集,以及生成任务的COCO17、CUB-200和Flickr30K数据集上,VAGS在结构保真度和生成质量上均一致优于固定CFG及近期免训练引导变体。代码已公开于https://github.com/Harvard-AI-and-Robotics-Lab/Velocity_Adaptive_Guidance_Scale。
引用
@article{arxiv.2605.15661,
title = {VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation},
author = {Yan Luo and Ahmadou Aidara and Jingyi Lu and Jeremy Moebel and Kai Han and Mengyu Wang},
journal= {arXiv preprint arXiv:2605.15661},
year = {2026}
}