中文

通过智能体执行的自适应任务重构提高图像编辑便利性

计算机视觉与模式识别 2026-04-20 v1

摘要

虽然最近的生成模型使引导式图像编辑取得了显著进展,但在许多看似简单的情况下仍难以产生可靠结果。我们注意到,这些失败的大部分原因并非源于模型容量不足,而是源于不良的任务表述,例如涉及小目标、隐式空间关系或不明确指令的情况。在本工作中,我们将图像编辑失败视为任务表述问题,提出一种自适应任务重构框架,通过分析、路由、重构和反馈驱动的细化来提高编辑性能,而无需修改底层模型。我们的关键思想是将原始图像-指令对转换为一系列动态确定并由MLLM智能体执行的操作。针对ImgEdit、PICA和RePlan等多个基准测试,以及Qwen Image Edit和Nano Banana等多种编辑骨架,进行实验,结果在各种挑战性案例中均显示出一致的改进,尤其是在困难案例中获得了显著的提升。这些结果表明,任务重构是一个关键但被忽视的因素,更好地将编辑任务匹配到现有模型有效运行的 regime 后,可以实现显著的性能提升。

关键词

引用

@article{arxiv.2604.15917,
  title  = {Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions},
  author = {Bo Zhao and Kairui Guo and Runnan Du and Haiyang Sun and Pengshan Wang and Huan Yang and Kun Gai and Yixin Cao and Wei Ji},
  journal= {arXiv preprint arXiv:2604.15917},
  year   = {2026}
}

备注

9pages