BIFRÖST:基于语言指令的 3D 感知图像合成
计算机视觉与模式识别
2024-10-30 v2 机器学习
摘要
本文介绍了 Bifröst,这是一个构建于扩散模型之上的新颖 3D 感知框架,用于执行基于指令的图像合成。以往的方法集中在 2D 层面的图像合成,在处理复杂空间关系(例如遮挡)时存在不足。Bifröst 通过将 MLLM 训练为 2.5D 位置预测器,并在生成过程中整合深度图作为额外条件以弥合 2D 与 3D 之间的差距,从而解决了这些问题,这增强了空间理解能力并支持复杂的空间交互。我们的方法首先利用定制的反事实数据集对 MLLM 进行微调,以根据语言指令在复杂背景中预测 2.5D 物体位置。然后,图像合成模型经过独特设计以处理多种类型的输入特征,使其能够执行考虑遮挡、深度模糊和图像协调的高保真图像合成。广泛的定性和定量评估表明,Bifröst 显著优于现有方法,为在需要复杂空间理解的场景中生成逼真的合成图像提供了稳健的解决方案。这项工作不仅推动了生成式图像合成的边界,还通过以创新方式有效利用现有资源,减少了对昂贵标注数据集的依赖。
引用
@article{arxiv.2410.19079,
title = {BIFR\"OST: 3D-Aware Image compositing with Language Instructions},
author = {Lingxiao Li and Kaixiong Gong and Weihong Li and Xili Dai and Tao Chen and Xiaojun Yuan and Xiangyu Yue},
journal= {arXiv preprint arXiv:2410.19079},
year = {2024}
}
备注
NeurIPS 2024, Code Available: https://github.com/lingxiao-li/Bifrost