中文

基于 Frank-Wolfe 策略优化的动作约束强化学习用于 HEVC/H.265 帧级码率分配

图像与视频处理 2022-03-11 v1 机器学习

摘要

本文提出一种利用 Frank-Wolfe 策略优化的强化学习(RL)框架,以解决 HEVC/H.265 的帧级码率分配问题。以往大多数基于 RL 的方法采用单评论家设计,通过经验选择的超参数对失真最小化和码率正则化的奖励进行加权。近来,双评论家设计被提出,通过交替使用码率评论家和失真评论家来更新 actor 网络。然而,其训练收敛性无法保证。为解决此问题,我们引入神经 Frank-Wolfe 策略优化(NFWPO),将帧级码率分配建模为动作约束 RL 问题。在该新框架中,码率评论家用于指定可行动作集,失真评论家在符合动作约束的同时更新 actor 网络以最大化重建质量。实验结果表明,当训练以优化视频多方法评估融合(VMAF)指标时,我们基于 NFWPO 的模型优于单评论家和双评论家方法,并且展现出与 x265 的 2-pass 平均码率控制相当的率失真性能。

关键词

引用

@article{arxiv.2203.05127,
  title  = {Action-Constrained Reinforcement Learning for Frame-Level Bit Allocation in HEVC/H.265 through Frank-Wolfe Policy Optimization},
  author = {Yung-Han Ho and Yun Liang and Chia-Hao Kao and Wen-Hsiao Peng},
  journal= {arXiv preprint arXiv:2203.05127},
  year   = {2022}
}