中文

面向复杂图像编辑的鲁棒顺序分解

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

近期视觉生成模型的进展使图像编辑能够通过人类指令实现高保真编辑。然而,这些模型常在涉及组合编辑操作或跨步骤依赖关系的复杂指令方面表现不佳。这一困难源于两种标准范式的局限性:(1)单轮编辑尝试一次性应用所有指示的编辑,常常无法准确解析复杂指令,导致不必要的编辑;(2)顺序编辑可将任务分解为更简单的步骤,但因顺序执行引入的误差累积,导致结果保真度低下。为此,我们在统一的上下文编辑框架下考察不同范式的编辑行为,研究如何在保持顺序分解优势的同时平衡其误差累积劣势。我们进一步构建合成数据管道,构建不同指令复杂度的编辑任务,筛选出大规模高质量分解序列的数据集。通过在合成数据上微调,我们发现只要设计得当,顺序分解即使在任务复杂度增加时也能稳健地实现改进。此外,来自合成任务中学到的分解技能可以通过与真实世界编辑数据共训练,迁移到真实图像上,展示了面向更广泛领域的复杂图像编辑的仿真到现实的泛化潜力。

关键词

引用

@article{arxiv.2605.09233,
  title  = {Towards Robust Sequential Decomposition for Complex Image Editing},
  author = {Zilai Zeng and Mingdeng Cao and Zijie Li and Xiaochen Lian and Yichun Shi and Peihao Zhu and Chen Sun and Peng Wang},
  journal= {arXiv preprint arXiv:2605.09233},
  year   = {2026}
}

备注

CVPR 2026