基于掩码感知双扩散的可感知功能对象插入
计算机视觉与模式识别
2025-04-22 v2
摘要
图像合成是一种常见的图像编辑操作,涉及将前景对象集成到背景场景中。本文将“感知功能”(Affordance)概念从以人类为中心的图像合成任务扩展到更通用的对象-场景合成框架,解决前景对象与背景场景之间复杂的相互作用。遵循感知功能的原理,我们定义了感知功能感知对象插入任务,该任务旨在 seamlessly 将任何对象插入任何场景中,并接受各种位置提示。为解决数据有限的问题并纳入此任务,我们构建了包含超过300万个示例、涵盖3000多个对象类别的SAM-FB数据集。此外,我们提出了掩码感知双扩散(MADD)模型,该模型采用双流架构同时对RGB图像和插入掩码进行去噪。通过在扩散过程中显式建模插入掩码,MADD有效地促进了感知功能的概念。大量实验结果表明,我们的方法在状态-of-the-art方法之上,并在野生图像上表现出强大的泛化性能。请参阅我们的代码 https://github.com/KaKituken/affordance-aware-any。
引用
@article{arxiv.2412.14462,
title = {Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion},
author = {Jixuan He and Wanhua Li and Ye Liu and Junsik Kim and Donglai Wei and Hanspeter Pfister},
journal= {arXiv preprint arXiv:2412.14462},
year = {2025}
}
备注
Code is available at: https://github.com/KaKituken/affordance-aware-any. Project page at: https://kakituken.github.io/affordance-any.github.io/