中文

VideoSPatS:用于离散遮挡、外观与运动建模与编辑的视频时空样条

图像与视频处理 2025-04-11 v1

摘要

我们提出了一种从单目视频中实现遮挡、外观和运动离散化的隐式视频表示方法,称为 Video 时空样条(VideoSPatS)。不同于将时间和坐标映射到变形和标准颜色的先前方法,VideoSPatS 将输入坐标映射到空间和颜色样条变形场 DsD_sDcD_c,从而在视频中实现运动和外观的离散化。凭借基于样条的参数化,本方法自然生成持续时间一致的光流,并保证长期时序一致性,这对于令人信服的视频编辑至关重要。通过多个预测分支,VideoSPatS 模型还能执行潜在视频与选定遮挡物之间的图层分离。凭借对遮挡、外观和运动的离散化,本方法能够实现对多样化视频的更佳时空建模与编辑,包括带有挑战性遮挡、阴影和光泽的野生谈话者视频,同时保持适当的标准空间进行编辑。我们还在 DAVIS 和 CoDeF 数据集上展示了一般视频建模结果,以及我们自采集的谈话者视频数据集。大量消融实验表明,DsD_sDcD_c 的组合在神经样条下能够克服运动和外观的歧义,为更先进的视频编辑模型铺平了道路。

关键词

引用

@article{arxiv.2504.07146,
  title  = {VideoSPatS: Video SPatiotemporal Splines for Disentangled Occlusion, Appearance and Motion Modeling and Editing},
  author = {Juan Luis Gonzalez Bello and Xu Yao and Alex Whelan and Kyle Olszewski and Hyeongwoo Kim and Pablo Garrido},
  journal= {arXiv preprint arXiv:2504.07146},
  year   = {2025}
}

备注

CVPR25, project website: https://juanluisg-flwls.github.io/videospats-website/