中文

重建不可见信息:基于孪生掩码条件变分自编码器的视频帧修复

计算机视觉与模式识别 2024-01-22 v1

摘要

在计算机视觉领域,视频帧中缺失信息的恢复是一个关键挑战,特别是在自动驾驶和监控系统等应用中。本文引入了孪生掩码条件变分自编码器(SiamMCVAE),利用基于视觉Transformer的孪生编码器构建孪生架构。这一创新设计通过捕捉成对帧之间的内在相似性,增强了模型理解丢失内容的能力。SiamMCVAE能够熟练地重建掩码帧中缺失的元素,通过变分推断有效解决由相机故障引起的问题。实验结果有力地证明了该模型在恢复缺失信息方面的有效性,从而增强了计算机视觉系统的鲁棒性。在SiamMCVAE中引入孪生视觉Transformer(SiamViT)编码器,展示了应对计算机视觉现实世界挑战的巨大潜力,增强了自主系统在动态环境中的适应能力。

关键词

引用

@article{arxiv.2401.10402,
  title  = {Reconstructing the Invisible: Video Frame Restoration through Siamese Masked Conditional Variational Autoencoder},
  author = {Yongchen Zhou and Richard Jiang},
  journal= {arXiv preprint arXiv:2401.10402},
  year   = {2024}
}