聚焦邻域,通晓全局:面向3D生成的一致稠密多视图文本到图像生成器
计算机视觉与模式识别
2024-08-27 v2
摘要
从文本提示生成稠密的多视图图像对于创建高保真3D资产至关重要。然而,现有方法在空间-视图对应关系上存在困难,导致输出稀疏且质量低下。本文介绍了CoSER,一种新颖的一致稠密多视图文本到图像生成器,用于文本到3D生成,通过精心学习邻域视图一致性并进一步通过快速遍历所有视图来消除歧义,实现了效率和质量的兼顾。为实现邻域视图一致性,每个视点与相邻视点密集交互以感知全局空间结构,并沿由物理原理明确定义的运动路径聚合信息以细化细节。为进一步增强跨视图一致性并减轻内容漂移,CoSER以螺旋双向方式快速扫描所有视图以感知整体信息,然后基于语义材质对每个点进行评分。随后,我们根据分数沿空间维度进行加权下采样,从而以轻量级计算促进所有视图间的显著信息融合。技术上,核心模块通过将注意力机制与选择性状态空间模型集成而构建,利用了前者的强大学习能力和后者的低开销。大量评估表明,CoSER能够生成稠密、高保真、内容一致的多视图图像,并可灵活集成到各种3D生成模型中。
引用
@article{arxiv.2408.13149,
title = {Focus on Neighbors and Know the Whole: Towards Consistent Dense Multiview Text-to-Image Generator for 3D Creation},
author = {Bonan Li and Zicheng Zhang and Xingyi Yang and Xinchao Wang},
journal= {arXiv preprint arXiv:2408.13149},
year = {2024}
}