基于层次化时空一致代理嵌入的矢量化视频表示及其易编辑性
计算机视觉与模式识别
2025-10-15 v1
摘要
当前视频表示方法过度依赖不稳定且粒度过大的运动和外观建模先验,即像素级匹配和跟踪。仅一两个像素的跟踪误差就会导致视觉对象表示的崩溃,更不用说视频中常见的遮挡和大位移。为克服上述脆弱性,本文提出时空一致的代理节点来表示视频中动态变化的对象/场景。一方面,层次化代理节点能够稳定地表达视觉对象的多尺度结构,因此不受累积跟踪误差、长期运动、遮挡和视角变化的影响。另一方面,代理节点的动态表示更新机制充分利用视频的时空先验,以有效处理不准确跟踪器的影响,从而有效处理场景和对象的剧烈变化。此外,跨不同视觉对象的形状和纹理表示的解耦编码方式促进了可控且细粒度的外观编辑能力。广泛的实验表明,所提出的表示方法在更少参数下实现了高视频重建精度,并支持视频修复和基于关键帧的时序一致视频编辑等复杂视频处理任务。
引用
@article{arxiv.2510.12256,
title = {Vectorized Video Representation with Easy Editing via Hierarchical Spatio-Temporally Consistent Proxy Embedding},
author = {Ye Chen and Liming Tan and Yupeng Zhu and Yuanbin Wang and Bingbing Ni},
journal= {arXiv preprint arXiv:2510.12256},
year = {2025}
}