中文

I2E:从图像像素到可交互环境的文本引导图像编辑

计算机视觉与模式识别 2026-04-08 v2

摘要

现有的文本引导图像编辑方法主要依赖基于像素的端到端填充范式。尽管在简单场景中取得成功,但该范式在需要精确局部控制和复杂多对象空间推理的组合编辑任务中仍显著困难。该范式受限于1)规划与执行的隐式耦合、2)缺乏对象级控制粒度、3)依赖非结构化、像素中心建模。为此,我们提出了I2E,一种新的“分解-然后-行动”范式,将图像编辑重新定义为结构化环境中可操作的交互过程。I2E利用分解器将非结构化图像转换为离散、可操作的对象层,随后引入基于物理的Vision-Language-Action智能体,通过链式思考推理将复杂指令解析为一系列原子操作。进一步,我们构建了I2E-Bench,一个用于多实例空间推理和高精度编辑的基准测试。实验结果表明,在I2E-Bench和多个公开基准测试上,I2E在处理复杂组合指令、保持物理合理性和确保多轮编辑稳定性方面显著优于最先进的方法。

关键词

引用

@article{arxiv.2601.03741,
  title  = {I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing},
  author = {Jinghan Yu and Junhao Xiao and Chenyu Zhu and Jiaming Li and Jia Li and HanMing Deng and Xirui Wang and Guoli Jia and Jianjun Li and Xiang Bai and Bowen Zhou and Zhiyuan Ma},
  journal= {arXiv preprint arXiv:2601.03741},
  year   = {2026}
}