VENUS:基于场景图的噪声反转视觉编辑
计算机视觉与模式识别
2026-01-13 v1
摘要
最新文本驱动图像编辑模型常难以在背景保留与语义一致性之间取得平衡,导致要么合成全新图像,要么输出未实现预期编辑。相比之下,基于场景图的图像编辑通过提供语义实体及其关系的结构化表示,实现了更好的可控性。然而,现有场景图编辑方法通常依赖模型微调,计算成本高且难以扩展。为此,我们引入 VENUS(Visual Editing with Noise inversion Using Scene graphs),即训练自由的场景图引导图像编辑框架。具体而言,VENUS 采用 split prompt 条件策略,将编辑目标对象与背景语境解耦,同时利用噪声反转保留未编辑区域的保真度。此外,我们的方法将来自多模态大语言模型提取的场景图与扩散模型主干集成,无需额外训练。经验上,VENUS 在 PIE-Bench 上显著提升背景保留与语义对齐,PSNR 从 22.45 提升至 24.80,SSIM 从 0.79 提升至 0.84,LPIPS 从 0.100 降至 0.070。在 EditVal 上,VENUS 实现最高保真度,DINO 分数达 0.87,关键是将每图像运行时间从 6-10 分钟缩短至仅 20-30 秒。除了场景图编辑外,VENUS 还超越了 LEDIT++ 和 P2P+DirInv 等强大的文本编辑基线,展示了在两种范式下均取得一致改进。
引用
@article{arxiv.2601.07219,
title = {VENUS: Visual Editing with Noise Inversion Using Scene Graphs},
author = {Thanh-Nhan Vo and Trong-Thuan Nguyen and Tam V. Nguyen and Minh-Triet Tran},
journal= {arXiv preprint arXiv:2601.07219},
year = {2026}
}