语义视频编码:将静态-动态线索注入结构化码流以支持AI任务
计算机视觉与模式识别
2022-05-10 v2 多媒体
摘要
传统媒体编码方案通常将图像/视频编码为语义未知的二进制码流,这无法在码流层面直接支持下游智能任务。语义结构化图像编码(SSIC)框架首次尝试通过语义结构化码流(SSB)实现免解码或部分解码的图像智能任务分析。然而,SSIC仅考虑图像编码,其生成的SSB仅包含静态物体信息。在本文中,我们从视频编码的角度扩展了语义结构化编码的思想,提出了一种先进的语义结构化视频编码(SSVC)框架,以支持异构智能应用。视频信号包含更丰富的动态运动信息,并因相邻帧间的相似性而存在更多冗余。因此,我们提出了SSVC中语义结构化码流(SSB)的重新表述,使其同时包含静态物体特征和动态运动线索。具体而言,我们引入光流来编码连续运动信息,并通过预测编码架构减少跨帧冗余,然后将光流和残差信息重新组织到SSB中,这使得所提出的SSVC能够更好地自适应支持基于视频的下游智能应用。大量实验表明,所提出的SSVC框架仅依赖部分解码的码流即可直接支持多种智能任务。这避免了全码流解压缩,从而显著节省了智能分析的比特率/带宽消耗。我们在图像目标检测、姿态估计、视频动作识别、视频目标分割等任务上验证了这一点。
引用
@article{arxiv.2201.10162,
title = {Semantically Video Coding: Instill Static-Dynamic Clues into Structured Bitstream for AI Tasks},
author = {Xin Jin and Ruoyu Feng and Simeng Sun and Runsen Feng and Tianyu He and Zhibo Chen},
journal= {arXiv preprint arXiv:2201.10162},
year = {2022}
}
备注
21 pages, 12 figures