基于 DiT 中的情境编辑的图像插入
计算机视觉与模式识别
2025-04-22 v1
摘要
本工作提出了 Insert Anything,一个统一的参考图像插入框架,可在灵活的用户指定控制指导下将来自参考图像中的对象无缝集成到目标场景中。与为每个单独任务训练独立模型不同,我们的方法仅需在包含 条提示-图像对的全新 AnyInsertion 数据集上训练一次,即可轻松泛化到广泛的插入场景。这种具有挑战性的设置要求同时捕捉身份特征和细粒度细节,同时允许在风格、颜色和纹理方面进行灵活的局部适应。为此,我们提出利用扩散转换器 (DiT) 的多模态注意力机制,支持基于掩码和文本的编辑。此外,我们引入情境编辑机制,将参考图像作为情境信息处理,采用两种提示策略在保持插入元素独特性特征的同时,将其与目标场景和谐共存。广泛的在 AnyInsertion、DreamBooth 和 VTON-HD 基准数据集上的实验表明,我们的方法始终优于现有方法,凸显其在创意内容生成、虚拟试穿和场景构图等实际应用中的巨大潜力。
引用
@article{arxiv.2504.15009,
title = {Insert Anything: Image Insertion via In-Context Editing in DiT},
author = {Wensong Song and Hong Jiang and Zongxing Yang and Ruijie Quan and Yi Yang},
journal= {arXiv preprint arXiv:2504.15009},
year = {2025}
}