Multitwine:基于文本和布局控制的多对象合成
计算机视觉与模式识别
2025-02-10 v1
摘要
我们提出了首个能够同时进行多对象合成的生成模型,该模型由文本和布局共同引导。我们的模型允许在场景中添加多个对象,捕捉从简单的位置关系(例如,旁边、前面)到需要重新调整姿态的复杂动作(例如,拥抱、弹吉他)等一系列交互。当交互暗示需要额外的道具时,例如“自拍”,我们的模型会自动生成这些辅助对象。通过联合训练合成和主题驱动生成(也称为定制化),我们在文本驱动的对象合成中实现了文本和视觉输入更均衡的整合。因此,我们获得了一个在这两项任务中均具有最先进性能的多功能模型。我们进一步提出了一种数据生成流程,利用视觉和语言模型轻松合成多模态、对齐的训练数据。
引用
@article{arxiv.2502.05165,
title = {Multitwine: Multi-Object Compositing with Text and Layout Control},
author = {Gemma Canet Tarrés and Zhe Lin and Zhifei Zhang and He Zhang and Andrew Gilbert and John Collomosse and Soo Ye Kim},
journal= {arXiv preprint arXiv:2502.05165},
year = {2025}
}