基于分解、压缩与合成(DCS)的视频编码:一种分辨率自适应学习的神经探索
计算机视觉与模式识别
2024-01-17 v5 图像与视频处理
信号处理
摘要
受视网膜细胞实际将视觉场景分离为不同属性(如空间细节、时间运动)以供各自神经元处理这一事实的启发,我们提出首先将输入视频分解为其原生空间分辨率下保留丰富空间细节的空间纹理帧(STF),以及较低空间分辨率下保留运动平滑性的时间运动帧(TMF);随后使用任意流行视频编码器将它们一起压缩;最后合成解码后的STF与TMF,以与原生输入相同的分辨率进行高保真视频重建。本工作仅在分解中采用双三次重采样、在压缩中采用符合HEVC的编解码器,并将重点置于合成部分。对于分辨率自适应合成,在TMFs上设计了一个运动补偿网络(MCN)以高效对齐并聚合时间运动特征,这些特征将使用非局部纹理迁移网络(NL-TTN)与相应STFs联合处理,以更好地增强空间细节,从而以更优的率失真效率有效缓解压缩与分辨率重采样噪声。这种“分解、压缩、合成(DCS)”基方案与编解码器无关,目前相对于使用参考软件的HEVC锚点展现出平均1 dB PSNR增益或25% BD-rate节省。此外,与最先进方法的实验比较及消融研究进一步报告了DCS算法的效率与泛化性,预示了未来视频编码的一个可喜方向。
引用
@article{arxiv.2012.00650,
title = {Decomposition, Compression, and Synthesis (DCS)-based Video Coding: A Neural Exploration via Resolution-Adaptive Learning},
author = {Ming Lu and Tong Chen and Dandan Ding and Fengqing Zhu and Zhan Ma},
journal= {arXiv preprint arXiv:2012.00650},
year = {2024}
}