中文

ViewMask-1-to-3: 基于多模态扩散模型的多视图一致图像生成

计算机视觉与模式识别 2026-03-16 v2

摘要

受离散扩散在语言-视觉建模方面成功的启发,我们探索其在多视图生成中的潜力,这一任务主要由连续方法主导。我们提出ViewMask-1-to-3,将多视图合成表述为离散序列建模问题,其中每个视角表示为来自MAGVIT-v2的视觉标记。通过掩码标记预测,我们的方法实现通过迭代标记取消掩码的渐进式多视图生成,在共享标记空间中统一语言和视觉。重要的是,简单随机掩码结合自注意力机制自然鼓励跨视图一致性,而无需专用架构或3D几何先验。我们的方法在GSO和3D-FUTURE基准测试上优于基线,在标准图像指标上平均排名第一,并在3D-FUTURE上提高10.6%的IoU。这一结果表明,离散扩散是多视图生成的有前景的候选方法。

关键词

引用

@article{arxiv.2512.14099,
  title  = {ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Diffusion Models},
  author = {Ruishu Zhu and Zhihao Huang and Jiacheng Sun and Ping Luo and Hongyuan Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2512.14099},
  year   = {2026}
}