TranStable: 联合Transformer和CNN以实现像素级在线视频稳定
计算机视觉与模式识别
2025-01-28 v1
摘要
视频稳定常面临畸变和过度裁剪问题。本文提出一种新型端到端框架,名为TranStable,以解决这些挑战,包括一个发生器和一个判别器。我们将TransformerUNet(TUNet)作为发生器,利用层次自适应融合模块(HAFM),集成Transformer和CNN以利用跨多个视觉线索的全局和局部特征。通过建模帧间关系,它生成稳健的像素级变形图,用于稳定的几何变换。此外,我们设计了稳定性判别器模块(SDM),在训练期间提供像素级监督,以确保真实性和一致性,同时最小化抖动痕迹并增强视觉保真度。在NUS、DeepStab和Selfie基准数据集上的大量实验表明,我们的方法在性能上达到最先进水平。
关键词
引用
@article{arxiv.2501.15138,
title = {TranStable: Towards Robust Pixel-level Online Video Stabilization by Jointing Transformer and CNN},
author = {zhizhen li and tianyi zhuo and Yifei Cao and Jizhe Yu and Yu Liu},
journal= {arXiv preprint arXiv:2501.15138},
year = {2025}
}