借助隐式运动变换重新思考生成式人体视频编码
计算机视觉与模式识别
2025-06-13 v1 图像与视频处理
摘要
超越传统的混合式视频编码器,生成式视频编码器可以通过将高维信号演化为紧凑的特征表示以实现编码器端的码流紧凑性,并开发显式运动场作为解码器端高质量重建的中间监督,从而有望实现优异的压缩性能。这一范式在人脸视频压缩中已取得了显著成功。然而,与人脸视频相比,人体视频由于其更复杂多样的运动模式而面临更大的挑战,即在使用显式运动引导进行生成式人体视频编码(GHVC)时,重建结果可能出现严重失真和运动不准确。因此,本文指出了基于显式运动的人体视频压缩方法的局限性,并研究了借助隐式运动变换(IMT)来提升 GHVC 性能的方法。具体而言,我们提出将复杂的人体信号表征为紧凑的视觉特征,并将这些特征转化为隐式运动引导以实现信号重建。实验结果证明了所提出的 IMT 范式的有效性,该范式可帮助 GHVC 实现高效压缩和高保真合成。
引用
@article{arxiv.2506.10453,
title = {Rethinking Generative Human Video Coding with Implicit Motion Transformation},
author = {Bolin Chen and Ru-Ling Liao and Jie Chen and Yan Ye},
journal= {arXiv preprint arXiv:2506.10453},
year = {2025}
}