GAP3D:面向3D生成的视觉语言模型潜在特征到补丁级嵌入的生成对齐
计算机视觉与模式识别
2026-05-29 v1
摘要
最近的一些方法将视觉语言模型(VLM)作为生成模型的条件编码器,通常依赖高昂的端到端训练或将特征映射到压缩表示,忽略了几何感知任务(如3D资产生成)所需的稠密空间结构。为此,我们提出了GAP3D(Generative Alignment of Patch-level embeddings),一种基于扩散模型的模块化方法,通过将VLM生成的潜在特征直接对齐到预训练图像编码器的完整补丁级特征空间,使冻结的下游生成模型能够将VLM作为条件编码器,同时保持空间结构化的条件信号。实验在3D资产生成上评估表明,该方法无需大规模3D数据,即可主要基于通用领域的图像-文本对进行训练。此外,它在多模态提示下展现出涌现性的零样本能力,尽管仅使用文本输入进行训练。最后,尽管目前侧重高层语义而非细粒细节,GAP3D证明了通过基于扩散模型的对齐,VLM与图像编码器特征空间之间的表示差距可部分弥合,迈出了通过生成对齐到稠密嵌入空间实现基础模型模块化集成的第一步。
引用
@article{arxiv.2605.28995,
title = {GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation},
author = {Polytimi Anna Gkotsi and Andrii Zadaianchuk and Mohammad Mahdi Derakhshani},
journal= {arXiv preprint arXiv:2605.28995},
year = {2026}
}