开源图像编辑模型是零样本视觉学习器
计算机视觉与模式识别
2026-05-07 v1 计算与语言
摘要
近期研究表明,大型生成模型能够解决其未经过显式训练的视觉任务。然而,现有证据依赖于闭源模型 (Veo 3, Nano Banana Pro) 或需要特定任务的指令微调,这使得公开可用的图像编辑模型是否具备开箱即用的零样本视觉能力仍悬而未决。我们在无需任何微调的情况下,对三个开源图像编辑模型——Qwen-Image-Edit、FireRed-Image-Edit 和 LongCat-Image-Edit——在密集视觉预测任务上进行了系统评估。我们在 NYUv2 和 DIODE 上对单目深度估计、在 NYUv2 上对表面法线估计、以及在 Cityscapes 上对语义分割进行了基准测试,涵盖了几何与语义场景理解。结果表明,开源图像编辑模型展现出非平凡的零样本视觉理解能力。在 NYUv2 表面法线任务上,FireRed-Image-Edit 实现了 的平均角度误差,超越了经过微调的 Marigold (),并在无需任何特定任务训练的情况下匹敌经过指令微调的 Vision Banana ()。在 NYUv2 深度估计任务上,LongCat-Image-Edit 通过仿射对齐获得了 ,而 Qwen-Image-Edit 在 DIODE Indoor 上领先 ()。在 Cityscapes 语义分割任务上,Qwen-Image-Edit 在 19 类级别上达到了 25.7 mIoU,在更粗粒度的 7 类级别上达到了 49.5 mIoU。通过比较三个独立训练的编辑模型,我们检验了零样本视觉能力是图像编辑预训练的涌现特性,而非特定模型的人为产物。代码、评估脚本及所有结果均已公开发布,以作为未来工作的可复现基线。
引用
@article{arxiv.2605.04566,
title = {Open-Source Image Editing Models Are Zero-Shot Vision Learners},
author = {Wei Liu and Jiaxin Lin and Rui Chen},
journal= {arXiv preprint arXiv:2605.04566},
year = {2026}
}