ReBotNet:快速实时视频增强
计算机视觉与模式识别
2023-03-24 v1
摘要
多数视频复原网络速度慢、计算负载高,无法用于实时视频增强。本工作中,我们设计了一种高效快速的框架,用于实际用例(如实时视频通话与视频流)的实时视频增强。我们提出的方法称为循环瓶颈混合网络(ReBotNet),采用双分支框架。第一分支通过使用基于 ConvNext 的编码器沿空间与时间维度对输入帧分词,并利用瓶颈混合器处理这些抽象词元来学习时空特征。为进一步提升时间一致性,第二分支直接在从各帧提取的词元上应用混合器。一个共用解码器随后合并两分支特征以预测增强帧。此外,我们提出一种循环训练方法,利用最后一帧的预测高效增强当前帧并改善时间一致性。为评估方法,我们构建了两个模拟真实视频通话与流媒体场景的新数据集,并在多个数据集上展示广泛结果:ReBotNet 以更低计算量、更少内存需求和更快推理时间优于现有方法。
引用
@article{arxiv.2303.13504,
title = {ReBotNet: Fast Real-time Video Enhancement},
author = {Jeya Maria Jose Valanarasu and Rahul Garg and Andeep Toor and Xin Tong and Weijuan Xi and Andreas Lugmayr and Vishal M. Patel and Anne Menini},
journal= {arXiv preprint arXiv:2303.13504},
year = {2023}
}
备注
Project Website: https://jeya-maria-jose.github.io/rebotnet-web/