中文

从规模到速度:图像编辑的自适应测试时扩展

计算机视觉与模式识别 2026-03-27 v3 人工智能 机器学习 图像与视频处理

摘要

图像链思(Image-CoT)是一种提升图像生成的测试时扩展范式。大多数 Image-CoT 方法聚焦于文本到图像(T2I)生成。不同于 T2I 生成,图像编辑是目标导向的:解空间受源图像和指令约束。这种不匹配导致将 Image-CoT 应用于编辑时的三个挑战:固定抽样预算下的资源分配效率低下,使用通用多模态大语言模型(MMLLM)分数进行早期验证不可靠,大规模抽样产生冗余编辑结果。为此,我们提出 ADaptive Edit-CoT(ADE-CoT),一种按需测试时扩展框架,以提高编辑效率和性能。它包含三个关键策略:(1)基于难度感知的资源分配,根据估计编辑难度分配动态预算;(2)早期剪枝中的编辑特定验证,使用区域定位和说明一致性选择有前景的候选方案;(3)深度优先机会性停止,由实例特定验证器指导,当发现意图对齐结果时即终止。广泛实验表明,在三个 SOTA 编辑模型(Step1X-Edit、BAGEL、FLUX.1 Kontext)上测试三个基准,ADE-CoT 在性能-效率权衡上实现优异表现。与 Best-of-N 相当的抽样预算下,ADE-CoT 实现超过 2 倍的速度提升。

关键词

引用

@article{arxiv.2603.00141,
  title  = {From Scale to Speed: Adaptive Test-Time Scaling for Image Editing},
  author = {Xiangyan Qu and Zhenlong Yuan and Jing Tang and Rui Chen and Datao Tang and Meng Yu and Lei Sun and Yancheng Bai and Xiangxiang Chu and Gaopeng Gou and Gang Xiong and Yujun Cai},
  journal= {arXiv preprint arXiv:2603.00141},
  year   = {2026}
}

备注

Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026