中文

基于自适应原点指导的编辑模型连续控制

计算机视觉与模式识别 2026-02-04 v1 图形学

摘要

扩散式编辑模型已成为语义图像和视频 manipulation 的强大工具。然而,现有模型缺乏对文本引导编辑强度进行平滑控制的机制。在标准文本条件生成中,无条件分类引导(Classifier-Free Guidance, CFG)影响提示遵循性,表明其作为编辑模型中编辑强度控制的潜在方法。然而,我们表明,在这些模型中对 CFG 进行比例放大并不会在输入与编辑结果之间产生平滑的过渡。我们将这种行为归因于无条件预测,它作为引导原点在低引导尺度下主导生成,同时代表对输入内容的任意操作。在实现连续控制方面,我们引入自适应原点引导(Adaptive-Origin Guidance, AdaOr),一种方法通过使用对应于 identity manipulation 的 identity 指令来调整标准引导原点。通过根据编辑强度将 identity 预测与标准无条件预测进行插值,我们确保从输入到编辑结果的连续过渡。我们在图像和视频编辑任务上对方法进行评估,结果表明,它提供的控制比当前基于滑块的编辑方法更平滑且更一致。该方法纳入 identity 指令到标准训练框架中,使其在推理时能够在无需 per-edit 操作或依赖专用数据集的情况下实现细粒度控制。

关键词

引用

@article{arxiv.2602.03826,
  title  = {Continuous Control of Editing Models via Adaptive-Origin Guidance},
  author = {Alon Wolf and Chen Katzir and Kfir Aberman and Or Patashnik},
  journal= {arXiv preprint arXiv:2602.03826},
  year   = {2026}
}

备注

Project page at https://adaor-paper.github.io/