中文

Voxify3D:像素艺术遇见体素渲染

计算机视觉与模式识别 2026-04-28 v2

摘要

体素艺术是一种广泛用于游戏和数字媒体的独特表现手法,但从3D网格自动生成仍具有挑战性,因为其几何抽象、语义保留和离散颜色一致性三方面的要求相互冲突。现有方法要么过于简化几何,要么无法实现像素精确、调色板受限的体素艺术美学。我们引入 Voxify3D,一个可微的两阶段框架,将3D网格优化与2D像素艺术监督相结合。我们的核心创新在于三个组件的协同集成:(1)正交像素艺术监督消除透视畸变,实现像素-像素精准对齐;(2)基于补丁的 CLIP 对齐在离散化水平上保持语义;(3)调色板受限的 Gumbel-Softmax 量化,实现对离散颜色空间的可微优化并支持可控调色板策略。该集成解决了以下根本性挑战:在极端离散化下的语义保留、通过体素渲染实现像素艺术美学、以及端到端离散优化。实验表明,Voxify3D 在 diverse characters 和可控抽象(2-8 种颜色,20-50 倍分辨率)方面表现卓越(37.12 CLIP-IQA,77.90% 用户偏好)。项目页面:https://yichuanh.github.io/Voxify-3D/。

关键词

引用

@article{arxiv.2512.07834,
  title  = {Voxify3D: Pixel Art Meets Volumetric Rendering},
  author = {Yi-Chuan Huang and Jiewen Chan and Hao-Jen Chien and Yu-Lun Liu},
  journal= {arXiv preprint arXiv:2512.07834},
  year   = {2026}
}

备注

CVPR 2026. Project page: https://yichuanh.github.io/Voxify-3D/