中文

基于分层深度学习分区预测的VP9帧内编码器加速

图像与视频处理 2020-07-30 v2 计算机视觉与模式识别 机器学习

摘要

在VP9视频编解码器中,块的大小通过在编码时利用率失真优化(RDO)递归划分64×\times64超级块来决定。由于超级块可能划分方式的组合搜索空间巨大,该过程计算密集。在此,我们提出一种基于深度学习的替代框架,使用分层全卷积网络(H-FCN)以四级划分树的形式预测帧内模式超级块划分。我们创建了大型VP9超级块及其对应划分的数据库来训练H-FCN模型,随后将其集成到VP9编码器中以减少帧内模式编码时间。实验结果表明,我们的方法平均加速帧内模式编码69.7%,代价是Bjontegaard-Delta码率(BD-rate)增加1.71%。尽管VP9提供了若干内置速度等级,旨在以率失真性能下降为代价提供更快编码,但我们发现,对于高质量帧内编码配置,我们的模型在加速比和BD-rate两方面均能优于参考VP9编码器最快的推荐速度等级。

关键词

引用

@article{arxiv.1906.06476,
  title  = {Speeding up VP9 Intra Encoder with Hierarchical Deep Learning Based Partition Prediction},
  author = {Somdyuti Paul and Andrey Norkin and Alan C. Bovik},
  journal= {arXiv preprint arXiv:1906.06476},
  year   = {2020}
}