中文

TranStable: 联合Transformer和CNN以实现像素级在线视频稳定

计算机视觉与模式识别 2025-01-28 v1

摘要

视频稳定常面临畸变和过度裁剪问题。本文提出一种新型端到端框架,名为TranStable,以解决这些挑战,包括一个发生器和一个判别器。我们将TransformerUNet(TUNet)作为发生器,利用层次自适应融合模块(HAFM),集成Transformer和CNN以利用跨多个视觉线索的全局和局部特征。通过建模帧间关系,它生成稳健的像素级变形图,用于稳定的几何变换。此外,我们设计了稳定性判别器模块(SDM),在训练期间提供像素级监督,以确保真实性和一致性,同时最小化抖动痕迹并增强视觉保真度。在NUS、DeepStab和Selfie基准数据集上的大量实验表明,我们的方法在性能上达到最先进水平。

关键词

引用

@article{arxiv.2501.15138,
  title  = {TranStable: Towards Robust Pixel-level Online Video Stabilization by Jointing Transformer and CNN},
  author = {zhizhen li and tianyi zhuo and Yifei Cao and Jizhe Yu and Yu Liu},
  journal= {arXiv preprint arXiv:2501.15138},
  year   = {2025}
}