Uni4D-LLM:面向4D场景理解与生成的统一时空感知视觉语言模型
计算机视觉与模式识别
2025-09-30 v1
摘要
视觉语言模型(VLM)在2D场景理解与生成方面已展现出强大的性能,但将这种统一性扩展到物理世界仍是开放挑战。现有3D和4D方法通常将场景几何嵌入自回归模型以进行语义理解,或嵌入扩散模型以进行内容生成。这种范式差距阻碍了单个模型同时处理两类任务,尤其是在时空建模至关重要的动态4D场景中。我们提出Uni4D-LLM,首个具备时空感知能力的统一VLM框架,用于4D场景理解与生成。我们的设计受指导两项关键洞见:1)统一性需要共享表征。我们提取语义特征用于理解,提取注入噪声的外观特征用于生成,融合4D几何线索,并通过自适应交叉注意力将其融合为时空感知视觉表征。2)统一性需要共享架构。自回归与扩散模型均基于Transformer骨干网络构建,这使其能够集成到单个LLM中,并配以任务特定的头部。通过对视觉与语言表征对齐,Uni4D-LLM在单个基于Transformer的框架内为理解与生成分别生成预测。我们进一步对多样化的4D视觉语言数据集进行指令微调,以提升跨任务的泛化能力。大量实验表明,Uni4D-LLM在多个基准测试上实现了与最先进模型相当或更优的性能,首次实现了4D场景理解与生成的真正统一。
引用
@article{arxiv.2509.23828,
title = {Uni4D-LLM: A Unified SpatioTemporal-Aware VLM for 4D Understanding and Generation},
author = {Hanyu Zhou and Gim Hee Lee},
journal= {arXiv preprint arXiv:2509.23828},
year = {2025}
}