编辑溢出作为探针:图像编辑模型是否隐式理解世界关系?
计算机视觉与模式识别
2026-03-19 v1
摘要
指令遵循的图像编辑模型应只修改指定区域,同时保持图像其余部分不变。然而,实际中我们观察到一种普遍现象——编辑溢出:模型会改变指定编辑区域之外的语义相关但未指定内容。这提出了一个根本性问题——溢出是反映出 genuine 隐式世界理解,还是仅仅是注意力泄漏?我们提出了EditSpilloverProbe,一个系统化将编辑溢出作为世界知识探针的框架。我们引入了一种溢出分类法(空间、语义、混合、随机),一个自动检测与分类的管道,以及一个由真实世界中文文本编辑任务构建的基准数据集EditSpilloverBench。对5个代表性编辑模型进行系统评估,发现三个核心发现:(1) 溢出率在不同架构之间差异很大,从3.49%到11.46%,比例为3.3倍;(2) 绝对语义溢出数量揭示了模型的世界理解能力——nano_banana产生最多语义溢出(27.8/图像),而qwen_2511具有最精确的编辑控制但语义溢出最低(16.3/图像),揭示了编辑控制与世界理解之间的权衡;(3) 空间衰减分析显示溢出区域密度随距离指数衰减,但语义相关溢出比例保持恒定(40%-58%),提供了直接证据表明语义溢出反映出 genuine 世界理解而非空间扩散。
引用
@article{arxiv.2603.17876,
title = {Edit Spillover as a Probe: Do Image Editing Models Implicitly Understand World Relations?},
author = {Guandong Li and Zhaobin Chu},
journal= {arXiv preprint arXiv:2603.17876},
year = {2026}
}