中文

基于3D Tokenizer 的 View-aware Auto-Regressive 用于文本到3D 生成的 VAR-3D 模型

计算机视觉与模式识别 2026-02-17 v1 机器学习

摘要

最近的自回归变压器在生成建模方面取得了显著成功。然而,文本到3D 生成仍具有挑战性,主要由于学习离散3D表示的瓶颈。具体而言,现有方法在编码过程中常常导致信息损失,导致量化过程前的表示失真。这种效应在向量量化中进一步放大,最终降低文本条件3D形状的几何一致性。此外,传统的两阶段训练范式导致重建和文本条件自回归生成之间目标不匹配。为解决这些问题,我们提出了View-aware Auto-Regressive 3D (VAR-3D),其整合了view-aware 3D Vector Quantized-Variational AutoEncoder (VQ-VAE) 将复杂的3D模型几何结构转换为离散标记。此外,我们引入渲染监督训练策略,将离散标记预测与视觉重建耦合,鼓励生成过程更好地保留与输入文本相关的视觉保真度和结构一致性。实验表明,VAR-3D 在生成质量和文本-3D 对齐方面显著优于现有方法。

关键词

引用

@article{arxiv.2602.13818,
  title  = {VAR-3D: View-aware Auto-Regressive Model for Text-to-3D Generation via a 3D Tokenizer},
  author = {Zongcheng Han and Dongyan Cao and Haoran Sun and Yu Hong},
  journal= {arXiv preprint arXiv:2602.13818},
  year   = {2026}
}