中文

VIAFormer:用于高保实体素优化的体素-图像对齐 Transformer

计算机视觉与模式识别 2026-01-22 v2

摘要

我们提出了 VIAFormer,一种体素-图像对齐 Transformer 模型,专为多视图条件体素优化而设计——即利用已标定的多视图图像作为引导,修复不完整含噪体素的任务。其有效性源于协同设计:为 2D 图像 token 提供显式 3D 空间基础的图像索引,学习直接体素优化轨迹的校正流目标,以及实现稳健跨模态融合的混合流 Transformer。实验表明,VIAFormer 在校正由强大视觉基础模型获得的体素形状上的严重合成损坏和真实伪影方面,确立了新的 SOTA。除基准测试外,我们展示了 VIAFormer 作为现实世界 3D 创作流程中实用且可靠的桥梁,为体素方法在大模型、大数据浪潮中蓬勃发展铺平了道路。

关键词

引用

@article{arxiv.2601.13664,
  title  = {VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement},
  author = {Tiancheng Fang and Bowen Pan and Lingxi Chen and Jiangjing Lyu and Chengfei Lyu and Chaoyue Niu and Fan Wu},
  journal= {arXiv preprint arXiv:2601.13664},
  year   = {2026}
}