LayerEdit:基于冲突感知的多层解耦式多目标编辑
计算机视觉与模式识别
2025-11-12 v1
摘要
旨在根据文本描述精确修改图像中多个对象的文本驱动式多目标图像编辑近年来受到广泛关注。现有工作主要遵循局部-编辑范式,聚焦于独立的对象定位与编辑,忽略了关键的物体间相互作用。然而,本工作指出,被忽略的物体间注意力纠缠在冲突区域本质上阻碍了解耦式多目标编辑,导致要么对象间编辑泄漏,要么对象内编辑受限。我们因此提出一种新型多层解耦编辑框架 LayerEdit,这是一种无需训练的方法,首次通过精确的对象分层分解与一致融合,实现冲突-free 对象分层编辑。具体而言,LayerEdit 引入一种“分解-编辑-融合”框架,包含:(1)冲突感知分层分解模块,通过注意力感知 IoU 方案和时序依赖区域移除,增强冲突感知与抑制以实现分层分解;(2)对象分层编辑模块,建立协调的层内文本指导与跨层几何映射,实现语义与结构的解耦修改;(3)透明度引导的分层融合模块,通过精确的透明度引导学习,促进结构一致的物体间分层融合。广泛实验验证表明,LayerEdit 在现有方法之上表现卓越,在复杂多目标场景中实现了前所未有的对象内可控性和对象间一致性。代码已公开:https://github.com/fufy1024/LayerEdit。
引用
@article{arxiv.2511.08251,
title = {LayerEdit: Disentangled Multi-Object Editing via Conflict-Aware Multi-Layer Learning},
author = {Fengyi Fu and Mengqi Huang and Lei Zhang and Zhendong Mao},
journal= {arXiv preprint arXiv:2511.08251},
year = {2025}
}
备注
The 40th Annual AAAI Conference on Artificial Intelligence