面向大规模三维检索与可控四维生成的三层对齐框架
计算机视觉与模式识别
2026-01-30 v1
摘要
我们提出了Uni4D,一个基于文本、三维模型和图像模态间结构化三层对齐的统一框架,用于大规模开放词汇三维检索与可控四维生成。Uni4D建立在Align3D 130数据集之上,采用三维文本多头注意力与搜索模型,通过改进的语义对齐来优化文本到三维的检索。该框架通过三个组件进一步加强跨模态对齐:精确的文本到三维检索、多视角三维到图像对齐,以及用于生成时间一致性四维资产的图像到文本对齐。实验结果表明,Uni4D实现了高质量的三维检索和可控的四维生成,推动了动态多模态理解与实用应用的发展。
引用
@article{arxiv.2512.22294,
title = {A Three-Level Alignment Framework for Large-Scale 3D Retrieval and Controlled 4D Generation},
author = {Philip Xu},
journal= {arXiv preprint arXiv:2512.22294},
year = {2026}
}
备注
arXiv admin note: Author list truncated. This submission has been withdrawn by arXiv administrators as authors were added without their knowledge or consent