神经资产:基于图像扩散模型的3D感知多对象场景合成
计算机视觉与模式识别
2024-10-30 v2 人工智能
机器学习
摘要
我们解决了图像扩散模型中多对象3D姿态控制的问题。我们不依赖于文本标记序列,而是提出使用一组逐对象表示——神经资产——来控制场景中单个对象的3D姿态。神经资产通过汇集参考图像(例如视频中的一帧)中对象的视觉表示获得,并训练用于在另一图像(例如视频中的后续帧)中重建相应对象。重要的是,我们在编码参考图像的对象视觉信息时,以目标帧的对象姿态为条件。这使得学习解耦的外观和姿态特征成为可能。将视觉和3D姿态表示以标记序列格式结合,使我们能够保持现有模型的文本到图像架构,用神经资产替代文本标记。通过使用此信息微调预训练的文本到图像扩散模型,我们的方法能够对场景中单个对象进行细粒度的3D姿态和位置控制。我们进一步证明,神经资产可以在不同场景之间转移和重组。我们的模型在合成3D场景数据集以及两个真实世界视频数据集(Objectron、Waymo Open)上均实现了最先进的多对象编辑结果。
引用
@article{arxiv.2406.09292,
title = {Neural Assets: 3D-Aware Multi-Object Scene Synthesis with Image Diffusion Models},
author = {Ziyi Wu and Yulia Rubanova and Rishabh Kabra and Drew A. Hudson and Igor Gilitschenski and Yusuf Aytar and Sjoerd van Steenkiste and Kelsey R. Allen and Thomas Kipf},
journal= {arXiv preprint arXiv:2406.09292},
year = {2024}
}
备注
Additional details and video results are available at https://neural-assets-paper.github.io/