视频分解先验:将视频分解为多个图层的方法论
计算机视觉与模式识别
2024-12-10 v2 机器学习
摘要
在视频增强与编辑方法日益演变的背景下,许多深度学习技术往往依赖大量观测输入与真实值序列对的训练数据以获得最佳性能。这种依赖在数据获取困难的任务(如视频去雾和视频 relighting)上常常不堪一击,尤其是当复制相同的运动和摄像机角度来获取受损与真实值序列在实际操作中十分困难。此外,这些传统方法在测试分布与训练分布高度吻合时才能表现最佳。鉴于上述挑战,本文引入了一种新型视频分解先验(VDP)框架,其灵感来自专业视频编辑实践。我们的 methodology 不要求收集任务特定的外部数据语料库,而是利用输入视频的运动与外观进行处理。VDP 框架将视频序列分解为多个 RGB 图层及其相关不透明度水平。这些图层随后可单独操作以实现所需效果。我们解决了视频对象分割、去雾和 relighting 等任务。此外,我们引入一种用于视频 relighting 的新型对数视频分解公式,为现有方法树立了新基准。我们观察到在优化新的 relighting 分解公式后,relighting 属性逐渐显现。我们在标准视频数据集(如 DAVIS、REVIDE、SDSD)上进行评估,并在多样化的互联网视频上展示了定性结果。项目页面 - https://www.cs.umd.edu/~gauravsh/video_decomposition/index.html 查看视频结果。
关键词
引用
@article{arxiv.2412.04930,
title = {Video Decomposition Prior: A Methodology to Decompose Videos into Layers},
author = {Gaurav Shrivastava and Ser-Nam Lim and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2412.04930},
year = {2024}
}
备注
Project Page - https://www.cs.umd.edu/~gauravsh/video_decomposition/index.html for video results. Extended version of ICLR publication