中文

基于强化学习的任务感知视频压缩:RL-RC-DoT 块级智能体

机器学习 2025-03-26 v2 计算机视觉与模式识别 图像与视频处理

摘要

视频编码器通过在比特率约束下最小化重构误差来优化人类感知压缩。在许多现代应用中,如自动驾驶,绝大多数视频作为人工智能系统(执行目标识别或分割等任务)的输入,而非供人类观看。因此,针对下游任务优化编码器而非感知图像质量变得有用。然而,一个主要挑战在于如何将此类下游优化与现有高效且流行的标准视频编码器结合起来。本文通过在宏块级别控制量化参数(QP),来实现针对下游任务的优化。这种细粒度控制允许我们在每个帧中优先处理与任务相关的区域。我们将此优化问题形式化为强化学习(RL)任务,其中智能体学习在任务性能和比特率约束之间进行权衡。值得注意的是,我们的策略在推理时无需下游任务作为输入,适用于流式应用和车辆等边缘设备。我们在两个任务(车辆检测和感兴趣区域[显著性]编码)上 demonstrate了显著的性能提升。我们的方法在给定比特率下比传统任务不可感知编码方法提高了任务性能,为更高效的任务感知视频压缩铺平了道路。

关键词

引用

@article{arxiv.2501.12216,
  title  = {RL-RC-DoT: A Block-level RL agent for Task-Aware Video Compression},
  author = {Uri Gadot and Assaf Shocher and Shie Mannor and Gal Chechik and Assaf Hallak},
  journal= {arXiv preprint arXiv:2501.12216},
  year   = {2025}
}