面向高质量 3D 生成的协作多模态编码
计算机视觉与模式识别
2026-02-24 v2
摘要
3D 内容本质上包含多模态特征,并可被投影到不同的模态(例如,RGB 图像、RGBD 和点云)。每种模态在 3D 资产建模中展现出独特的优势:RGB 图像包含生动的 3D 纹理,而点云则定义了精细的 3D 几何结构。然而,现有的大多数 3D 原生生成架构要么主要在单模态范式内运行——从而忽视了多模态数据的互补优势——要么将自身限制于 3D 结构,从而限制了可用训练数据集的范围。为了全面利用多模态进行 3D 建模,我们提出了 TriMM,这是第一个从基础多模态(例如 RGB、RGBD 和点云)中学习的前馈式 3D 原生生成模型。具体来说,1) TriMM 首先引入了协作多模态编码,该编码整合了模态特定特征,同时保留了它们独特的表示优势。2) 此外,引入了辅助的 2D 和 3D 监督,以提高多模态编码的鲁棒性和性能。3) 基于嵌入的多模态编码,TriMM 采用三平面潜在扩散模型来生成质量卓越的 3D 资产,同时增强了纹理和几何细节。在多个知名数据集上的大量实验表明,尽管使用了少量训练数据,TriMM 通过有效利用多模态,取得了与在大规模数据集上训练的模型相竞争的性能。此外,我们在最近的 RGB-D 数据集上进行了额外实验,验证了将其他多模态数据集纳入 3D 生成的可行性。
引用
@article{arxiv.2508.15228,
title = {Collaborative Multi-Modal Coding for High-Quality 3D Generation},
author = {Ziang Cao and Zhaoxi Chen and Liang Pan and Ziwei Liu},
journal= {arXiv preprint arXiv:2508.15228},
year = {2026}
}