HOTS3D:面向文本到3D生成语义对齐的超球面最优传输
计算机视觉与模式识别
2025-07-08 v2
摘要
近期基于CLIP引导的3D生成方法取得了令人鼓舞的成果,但由于文本与图像嵌入之间存在差距,难以生成符合输入文本的忠实3D形状。为此,本文提出HOTS3D,首次尝试通过球面最优传输(SOT)将文本特征与图像特征对齐,从而有效弥合这一差距。然而,在高维情况下,求解SOT仍然是一个挑战。为获得从CLIP编码的两种模态高维特征的SOT映射,我们基于Villani定理进行数学公式化并推导出解,该解可直接对齐两个超球面分布,无需流形指数映射。此外,我们利用输入凸神经网络(ICNN)实现最优Kantorovich势函数。获得最优映射特征后,利用基于扩散的生成器将其解码为3D形状。与最先进方法的广泛定量和定性比较证明了HOTS3D在文本到3D生成方面的优越性,尤其是在与文本语义的一致性方面。
引用
@article{arxiv.2407.14419,
title = {HOTS3D: Hyper-Spherical Optimal Transport for Semantic Alignment of Text-to-3D Generation},
author = {Zezeng Li and Weimin Wang and Yuming Zhao and Wenhai Li and Na Lei and Xianfeng Gu},
journal= {arXiv preprint arXiv:2407.14419},
year = {2025}
}
备注
accepted by tvcg