标准图像和视频编解码器下的深度视觉性能观察
计算机视觉与模式识别
2024-10-08 v1 多媒体
摘要
资源受限的硬件(如边缘设备或手机)常常依赖云服务器为深度视觉模型提供所需的推理计算资源。然而,传输图像和视频数据至云端服务器需应对网络限制,编码是必不可少的手段。标准化编解码器(如JPEG或H.264)因其普及性和互操作性而被广泛采用。本文旨在考察在深度视觉管道中采用标准化编解码器的影响。我们发现,采用JPEG和H.264编码显著恶化了跨广泛视觉任务和模型的准确性。例如,强压缩导致语义分割精度在mIoU上下降超过80%。与先前研究不同,本文的分析超越了图像和动作分类,涵盖定位和稠密预测任务,从而提供了更为全面的视角。
引用
@article{arxiv.2404.12330,
title = {A Perspective on Deep Vision Performance with Standard Image and Video Codecs},
author = {Christoph Reich and Oliver Hahn and Daniel Cremers and Stefan Roth and Biplob Debnath},
journal= {arXiv preprint arXiv:2404.12330},
year = {2024}
}
备注
Accepted at CVPR 2024 Workshop on AI for Streaming (AIS)