自动生成多视图一致图像
计算机视觉与模式识别
2025-07-15 v2
摘要
从人类指令生成多视图图像对于3D内容创建至关重要。主要挑战在于维持多个视图间的一致性,并在多样化条件下有效合成形状和纹理。在本文中,我们提出了多视图自回归(MV-AR)方法,利用自回归模型逐步生成来自任意提示的一致多视图图像。首先,AR模型的下一标记预测能力显著增强了其在促进多视图合成方面的效果。当生成跨越广泛视图时,MV-AR可利用其前述所有视图来提取有效参考信息。随后,我们提出一种统一模型,通过架构设计和训练策略适应各种提示。为解决多条件问题,我们引入针对文本、相机姿态、图像和形状的条件注入模块。为管理多模态条件,采用渐进式训练策略。该策略首先以文本到多视图(t2mv)模型为基线,以增强开发全面的X到多视图(X2mv)模型的能力,通过随机丢弃和组合条件。最后,为缓解由于高质量数据有限导致的过拟合问题,我们提出了“Shuffle View”数据增强技术,从而显著扩大了训练数据的规模。实验表明,我们的MV-AR在各种条件下均能持续生成一致的多视图图像,并与领先的基于扩散的多视图图像生成模型持平。代码和模型已发布于https://github.com/MILab-PKU/MVAR。
引用
@article{arxiv.2506.18527,
title = {Auto-Regressively Generating Multi-View Consistent Images},
author = {JiaKui Hu and Yuxiao Yang and Jialun Liu and Jinbo Wu and Chen Zhao and Yanye Lu},
journal= {arXiv preprint arXiv:2506.18527},
year = {2025}
}
备注
Accepted by ICCV 2025. Code is at https://github.com/MILab-PKU/MVAR