并非所有帧特征都等价:通过解耦动态-静态特征实现视频到四维生成
计算机视觉与模式识别
2025-06-30 v3
摘要
最近, 从视频生成动态三维物体的技术取得了令人瞩目的成果。现有方法直接优化帧中整体信息所对应的高斯函数。然而,当动态区域在帧内与静态区域交织,尤其是静态区域占据相当大比例时,现有方法往往忽略动态区域的信息,并容易对静态区域过拟合。这导致生成结果出现纹理模糊。我们认为,通过解耦动态-静态特征以增强动态表征可缓解此问题。因此,我们提出了一种动态-静态特征解耦模块(DSFD)。在时间轴上,该模块将当前帧特征相对于参考帧特征差异显著的区域视为动态特征,而将剩余部分视为静态特征。随后,我们驱动解耦特征的生成。此外,为进一步增强来自不同视角的解耦特征的动态表征,并确保精确的运动预测,我们设计了一种时空相似性融合模块(TSSF)。在空间轴上,该模块自适应地选择动态区域的相似信息。基于上述方法,我们构建了一种新颖的框架,即DS4D。实验结果验证,我们的方法在视频到四维生成任务中实现了最先进(SOTA)的结果。此外,针对真实世界场景数据集的实验表明,其在四维场景中的有效性。我们的代码将公开获取。
引用
@article{arxiv.2502.08377,
title = {Not All Frame Features Are Equal: Video-to-4D Generation via Decoupling Dynamic-Static Features},
author = {Liying Yang and Chen Liu and Zhenwei Zhu and Ajian Liu and Hui Ma and Jian Nong and Yanyan Liang},
journal= {arXiv preprint arXiv:2502.08377},
year = {2025}
}
备注
Accepted by ICCV2025