基于轨迹引导的超低比特率生成式视频编码
计算机视觉与模式识别
2025-11-12 v4 多媒体
摘要
近期视频生成技术的进展催生了一种以生成式先验处理超低比特率 (ULB) 场景的新范式。然而,大多数现有方法受限于领域特定性(如面部或人类视频)或过度依赖高层文本指导,这些指导往往难以充分捕捉细粒度运动细节,导致重构不真实或不连贯。为解决这些挑战,我们提出了轨迹引导的生成式视频编码 (T-GVC),一种新型框架,将低层运动跟踪与高层语义理解相结合。T-GVC 具备基于语义重要性提取稀疏运动采样管线的特征,从而在保持关键时序语义信息的同时显著降低比特率。此外,通过将轨迹对齐损失约束集成到扩散过程中,我们引入了潜在空间中的一种训练-free 指导机制,以确保物理上可信的运动模式,而不牺牲生成模型的固有能力。实验结果表明,在 ULB 条件下,T-GVC 优于传统和神经视频编码器。此外,额外实验确认,我们框架实现的运动控制比现有文本引导方法更精确,为由几何运动建模引导的生成式视频编码开辟了新的方向。
引用
@article{arxiv.2507.07633,
title = {T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates},
author = {Zhitao Wang and Hengyu Man and Wenrui Li and Xingtao Wang and Xiaopeng Fan and Debin Zhao},
journal= {arXiv preprint arXiv:2507.07633},
year = {2025}
}