中文

稀疏到稠密:基于关键点的人类视频压缩与顶点预测生成框架

计算机视觉与模式识别 2025-09-30 v1

摘要

在带宽受限的多媒体应用中,同时实现超低码率人类视频压缩和精确顶点预测仍是关键挑战,因为这要求动态运动建模、细节外观合成与几何一致性协调统一。为此,我们提出Sparse2Dense——一种基于关键点的生成框架,利用极度稀疏的 3D 关键点作为紧凑传输符号,以实现人类视频的超低码率压缩和精准的人类顶点预测。关键创新点在于基于多任务学习的关键点感知深度生成模型,它能够通过紧凑的 3D 关键点编码复杂的人类运动,并利用这些稀疏关键点估计密集运动,用于视频合成,确保时间一致性和真实纹理。此外,还集成了一个顶点预测器,通过联合优化视频生成来学习人类顶点几何,确保视觉内容与几何结构对齐。大量实验表明,所提出的Sparse2Dense 框架在传统/生成视频编解码器基础上,实现了人类视频的具竞争力的压缩性能,同时为下游几何应用实现了精准的人类顶点预测。因此,Sparse2Dense 有望促进面向带宽效率的以人类为中心的媒体传输,如实时运动分析、虚拟人动画和沉浸式娱乐。

关键词

引用

@article{arxiv.2509.23169,
  title  = {Sparse2Dense: A Keypoint-driven Generative Framework for Human Video Compression and Vertex Prediction},
  author = {Bolin Chen and Ru-Ling Liao and Yan Ye and Jie Chen and Shanzhi Yin and Xinrui Ju and Shiqi Wang and Yibo Fan},
  journal= {arXiv preprint arXiv:2509.23169},
  year   = {2025}
}