面向视觉分析的率失真模型用于图像编码
图像与视频处理
2021-04-22 v1 计算机视觉与模式识别
摘要
现有图像编解码器针对像素保真度指标进行优化,在用于视觉分析任务时面临系统性挑战,尤其在低码率编码下。本文提出一种面向视觉分析的率失真模型,用于通用视频编码(VVC)帧内压缩。该模型有两项主要贡献:一种新颖的码率分配策略和一种新的失真度量模型。我们首先提出面向机器的感兴趣区域(ROIM)来评估每个编码树单元(CTU)在视觉分析中的重要程度。然后,基于ROIM和每个CTU的局部纹理特征,提出一种新颖的CTU级码率分配模型。在深入分析多种失真模型后,通过提取每个编码单元(CU)的深度特征,提出一种对视觉分析友好的失真准则。为缓解计算每个CU失真时缺乏空间上下文信息的问题,我们最终提出一种多尺度特征失真(MSFD)度量,通过对各尺度提取的深度特征加权利用不同邻域像素。大量实验结果表明,在图像分类、目标检测和语义分割等若干典型视觉分析任务中,所提方案在相同分析性能下可节省高达28.17%的码率。
引用
@article{arxiv.2104.10315,
title = {Visual Analysis Motivated Rate-Distortion Model for Image Coding},
author = {Zhimeng Huang and Chuanmin Jia and Shanshe Wang and Siwei Ma},
journal= {arXiv preprint arXiv:2104.10315},
year = {2021}
}