DreamFuse:基于扩散转换器的自适应图像融合
计算机视觉与模式识别
2025-04-14 v1
摘要
图像融合旨在无缝地将前景物体与背景场景集成,生成逼真且和谐的融合图像。与现有方法直接将物体插入背景不同,自适应和交互式融合仍是一个具有挑战性又引人入胜的任务。它要求前景物体调整或与背景背景环境进行交互,从而实现更一致的集成。为此,我们提出了一个迭代的人类在环数据生成管道,该管道利用有限的初始数据和多样化的文本提示,在各种场景和交互(包括放置、持有、穿戴和风格迁移)中生成融合数据集。基于此,我们引入DreamFuse,这是一种基于扩散转换器(DiT)模型的新方法,用于生成包含前景和背景信息的一致且和谐的融合图像。DreamFuse采用位置仿射机制将前景的大小和位置注入背景中,通过共享注意力实现有效的前景-背景交互。此外,我们应用由人类反馈引导的局部直接偏好优化来细化DreamFuse,增强背景一致性和前景和谐性。DreamFuse在保持和谐融合的同时,能够通用于文本驱动的属性编辑。实验结果表明,我们的方法在多个指标上均优于最先进的方法。
引用
@article{arxiv.2504.08291,
title = {DreamFuse: Adaptive Image Fusion with Diffusion Transformer},
author = {Junjia Huang and Pengxiang Yan and Jiyang Liu and Jie Wu and Zhao Wang and Yitong Wang and Liang Lin and Guanbin Li},
journal= {arXiv preprint arXiv:2504.08291},
year = {2025}
}
备注
under review