DreamView:将特定视角文本引导注入文本到 3D 生成
计算机视觉与模式识别
2024-07-16 v2
摘要
根据整体文本描述合成 3D 资产的文本到 3D 生成已取得显著进展。然而,当需要在指定视角自定义特定外观,但仅依靠整体描述来生成 3D 对象时,便出现了挑战。例如,当使用单一整体文本引导生成正反面具有不同图案的 T 恤时,很容易产生歧义。在这项工作中,我们提出了 DreamView,一种文本到图像的方法,通过协同文本引导注入模块自适应地注入特定视角和整体文本引导,在保持整体一致性的同时实现多视角自定义,该方法也可通过分数蒸馏采样提升至 3D 生成。DreamView 使用大规模渲染的多视角图像及其对应的特定视角文本进行训练,学习平衡每个视角中的独立内容操作与整体对象的全局一致性,从而实现自定义与一致性的双重成就。因此,DreamView 赋予艺术家创造性地设计 3D 对象的能力,促进了更具创新性和多样性的 3D 资产的创建。代码和模型将发布于 https://github.com/iSEE-Laboratory/DreamView。
引用
@article{arxiv.2404.06119,
title = {DreamView: Injecting View-specific Text Guidance into Text-to-3D Generation},
author = {Junkai Yan and Yipeng Gao and Qize Yang and Xihan Wei and Xuansong Xie and Ancong Wu and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2404.06119},
year = {2024}
}
备注
Accepted to ECCV 2024, camera ready version