通过大语言模型推理理解图像编辑中的隐式用户意图
计算机视觉与模式识别
2025-11-03 v1
摘要
现有图像编辑方法能够很好地处理简单编辑指令。但为处理复杂编辑指令,往往需要联合微调大语言模型(LLM)和扩散模型(DM),这涉及极高的计算复杂度和训练成本。为此,我们提出了一种新方法,称为Complex Image Editing via LLM Reasoning (CIELR),将复杂用户指令转换为一组简单且明确的编辑动作,从而消除对联合微调大语言模型和扩散模型的需求。具体而言,我们首先使用基础模型构建输入图像的结构化语义表示。随后,我们引入一种迭代更新机制,逐步细化该表示,获得图像场景的细粒度视觉表示。这使我们能够执行复杂且灵活的图像编辑任务。针对SmartEdit推理情景集合中的大量实验表明,我们的方法在PSNR上比以前的状态方法提高了9.955 dB,表明其在保持应保持一致的区域方面具有优势。由于公开复杂图像编辑推理数据集样本有限,我们构建了一个名为CIEBench的基准,包含86个图像样本,同时为推理基于图像编辑开发了一个专用的指标。CIELR在该基准上也优于以前的方法。代码和数据集已发布于\href{https://github.com/Jia-shao/Reasoning-Editing}{https://github.com/Jia-shao/Reasoning-Editing}。
引用
@article{arxiv.2510.27335,
title = {Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing},
author = {Yijia Wang and Yiqing Shen and Weiming Chen and Zhihai He},
journal= {arXiv preprint arXiv:2510.27335},
year = {2025}
}