基于强化学习的任务驱动语义编码
图像与视频处理
2021-06-08 v1 多媒体
摘要
随着车牌检测、人脸检测和医疗诊断等智能媒体应用的发展,任务驱动语义视频/图像编码因关注保持视频/图像的语义信息而受到相当关注。基于深度神经网络(DNN)的编解码器因其固有的端到端优化机制而被研究用于此目的。然而,传统混合编码框架无法以端到端方式优化,这使得任务驱动语义保真度度量无法自动集成到率失真优化过程中。因此,用传统混合编码框架实现任务驱动语义编码仍然具有吸引力和挑战性,该框架在相当长时间内仍将在实际工业中广泛使用。为解决这一挑战,我们为不同任务设计语义图以提取视频/图像的逐像素语义保真度。我们没有直接将语义保真度度量集成到传统混合编码框架中,而是通过基于强化学习(RL)的语义比特分配来实现任务驱动语义编码。我们将语义比特分配问题表述为马尔可夫决策过程(MDP),并利用一个RL智能体根据任务驱动语义保真度度量自动确定不同编码单元(CU)的量化参数(QP)。在不同任务(如分类、检测和分割)上的大量实验表明,在等效任务相关语义保真度下,与高效率视频编码(H.265/HEVC)锚点相比,我们的方法实现了34.39%至52.62%的平均码率节省,性能优越。
引用
@article{arxiv.2106.03511,
title = {Task-driven Semantic Coding via Reinforcement Learning},
author = {Xin Li and Jun Shi and Zhibo Chen},
journal= {arXiv preprint arXiv:2106.03511},
year = {2021}
}
备注
13 pages, accepted by IEEE Transactions on Image Processing (TIP)