中文

迈向在线实时基于记忆的视频修复 Transformer

计算机视觉与模式识别 2024-03-26 v1

摘要

近年来,随着深度神经网络,尤其是视觉 Transformer 的兴起,视频修复任务取得了显著进展。尽管这些模型展现出良好的重建质量和时间一致性,但它们仍不适用于实时视频处理,而这正是使其完全令人信服和可用的最后一步之一。主要限制在于,这些最先进的模型使用整个视频进行修复(离线处理),且帧率不足。在我们的方法中,我们提出了一种框架,通过记忆并优化冗余计算来使现有的修复 Transformer 适应这些约束,同时保持良好的修复质量。将该框架与一些最新的修复模型结合使用,我们展示了出色的在线处理结果,且吞吐量持续保持在每秒 20 帧以上。代码和预训练模型将在论文被接收后公开。

关键词

引用

@article{arxiv.2403.16161,
  title  = {Towards Online Real-Time Memory-based Video Inpainting Transformers},
  author = {Guillaume Thiry and Hao Tang and Radu Timofte and Luc Van Gool},
  journal= {arXiv preprint arXiv:2403.16161},
  year   = {2024}
}