VIBE:基于视觉指令的图像编辑器
计算机视觉与模式识别
2026-01-06 v1 人工智能
机器学习
摘要
基于指令的图像编辑是生成式AI领域中最快速发展的方向之一。过去一年,该领域取得了新的高度,孵育出大量开源模型,伴随高度强大的商业系统。然而,仅有少数开源方法能够实现实际应用中的高质量。此外,扩散模型作为这些管道的主导选择,往往在许多部署和研究场景下都大型且计算成本高高,通常包含6B至20B参数。本文提出一种紧凑、高吞吐量的指令式图像编辑管道,采用现代2B参数的Qwen3-VL模型引导编辑过程,并使用1.6B参数的扩散模型Sana1.5进行图像生成。我们在架构、数据处理、训练配置和评估方面的设计决策旨在实现低成本推理和严格的源一致性,同时在主要可行编辑类别下保持高质量。评估于ImgEdit和GEdit基准,所提方法在准确率和质量上与参数更大、推理成本更高的基线模型相当,甚至优于其表现,特别是在需要保留输入图像的编辑(如属性调整、对象删除、背景编辑和定向替换)方面表现尤为突出。在NVIDIA H100上使用BF16,无需额外推理优化或蒸馏,即可在约4秒内将编辑后图像生成至最高2K分辨率,模型占用GPU内存不足24GB。
引用
@article{arxiv.2601.02242,
title = {VIBE: Visual Instruction Based Editor},
author = {Grigorii Alekseenko and Aleksandr Gordeev and Irina Tolstykh and Bulat Suleimanov and Vladimir Dokholyan and Georgii Fedorov and Sergey Yakubson and Aleksandra Tsybina and Mikhail Chernyshov and Maksim Kuprashevich},
journal= {arXiv preprint arXiv:2601.02242},
year = {2026}
}