中文

面向带视觉效果分层图像生成的统一可控框架

计算机视觉与模式识别 2026-05-11 v2

摘要

近期的图像生成模型能够生成令人印象深刻的合成图像,但在编辑特定元素时往往无法保留用户提供内容的身份:周围场景可能发生偏移,甚至被编辑对象的外观也可能偏离原始状态。分层表示提供了一种自然的解决方案——它允许用户独立操作各个元素——但现有的分层方法通常生成没有阴影和反射等逼真视觉效果的透明前景,迫使在每次编辑后使用第二个融合模型,这反过来又引入了漂移。为了克服这些局限性,我们提出了 LASAGNA,它在前向传播中一次性生成逼真的背景 (BG) 和带有引人注目视觉效果的 RGBA 前景。通过将与对象关联的视觉效果视为前景 (FG) 层的一部分,LASAGNA 仅通过 alpha 合成即可支持主流的消费者编辑操作(例如,平移、缩放、重新着色、复制),而无需在编辑后调用任何模型,从而消除了由级联编辑流程引入的身份漂移。这种单次设计有别于之前为每个任务依赖独立专家模型的分层方法。LASAGNA 在统一架构内处理多种条件输入——文本提示、前景、背景和位置掩码。我们进一步发布了两个社区资源:LASAGNA-48K,这是首个包含 48K 带有逼真视觉效果分层图像三元组的公开数据集;以及 LASAGNA-BENCH,这是首个以图层为中心的生成与编辑标准化基准,包含来自六个不同来源的 242 个专家标注样本。实验表明,LASAGNA 在三种生成模式下均优于通用编辑器和先前的分层方法,并在无需任何模型重推理的情况下支持广泛的后期编辑。

关键词

引用

@article{arxiv.2601.15507,
  title  = {A Unified and Controllable Framework for Layered Image Generation with Visual Effects},
  author = {Jinrui Yang and Qing Liu and Yijun Li and Mengwei Ren and Letian Zhang and Zhe Lin and Cihang Xie and Yuyin Zhou},
  journal= {arXiv preprint arXiv:2601.15507},
  year   = {2026}
}