中文

PLA4D:用于文本到4D高斯泼溅的像素级对齐

计算机视觉与模式识别 2024-11-20 v4 人工智能

摘要

先前的文本到4D方法利用了多种分数蒸馏采样(SDS)技术,将基于视频的扩散模型(DM)的运动先验与多视图DM的几何先验相结合,隐式地引导4D渲染。然而,这些先验的差异导致优化过程中梯度方向冲突,造成运动保真度和几何精度之间的权衡,并且需要大量优化时间来协调模型。在本文中,我们引入像素级对齐用于文本驱动的4D高斯泼溅(PLA4D)来解决这种运动-几何冲突。PLA4D提供了一个锚定参考,即文本生成的视频,以在像素空间中对齐由不同DM条件化的渲染过程。对于静态对齐,我们的方法引入了焦点对齐方法和高斯-网格对比学习,以迭代调整焦距并在每个时间步提供显式几何先验。在动态层面,采用运动对齐技术和T-MV细化方法来强制未知视角下的姿态对齐和运动连续性,确保跨视图的内在几何一致性。通过这种像素级多DM对齐,我们的PLA4D框架能够生成具有优越几何、运动和语义一致性的4D对象。完全使用开源工具实现,PLA4D为高质量4D数字内容创作提供了高效且可访问的解决方案,并显著减少了生成时间。

关键词

引用

@article{arxiv.2405.19957,
  title  = {PLA4D: Pixel-Level Alignments for Text-to-4D Gaussian Splatting},
  author = {Qiaowei Miao and JinSheng Quan and Kehan Li and Yawei Luo},
  journal= {arXiv preprint arXiv:2405.19957},
  year   = {2024}
}