利用元学习实现可控的全帧视频稳定
计算机视觉与模式识别
2025-08-27 v1
摘要
视频稳定仍然是计算机视觉中的一个基本问题,特别是用于视频稳定的像素级合成解决方案,它们合成全帧输出,增加了该任务的复杂性。这些方法旨在增强稳定性的同时合成全帧视频,但每个视频序列中运动特征和视觉内容的固有多样性使得使用固定参数进行稳健泛化变得困难。为了解决这个问题,我们提出了一种新方法,通过在测试时快速将模型适应每个输入视频来改进像素级合成视频稳定方法。所提出的方法利用推理期间可用的低级视觉线索来改善输出的稳定性和视觉质量。值得注意的是,所提出的快速适应即使在单次适应过程中也能实现显著的性能提升。我们进一步提出了抖动定位模块和有针对性的适应策略,将适应集中在高抖动片段上,以最少的适应步骤最大化稳定性。所提出的方法使现代稳定器能够克服长期存在的 SOTA 方法,同时保持现代方法的全帧特性,并为用户提供类似于经典方法的控制机制。在多样化真实世界数据集上的大量实验证明了所提出方法的通用性。我们的方法在定性和定量方面持续改进各种全帧合成模型的性能,包括在下游应用上的结果。
引用
@article{arxiv.2508.18859,
title = {Harnessing Meta-Learning for Controllable Full-Frame Video Stabilization},
author = {Muhammad Kashif Ali and Eun Woo Im and Dongjin Kim and Tae Hyun Kim and Vivek Gupta and Haonan Luo and Tianrui Li},
journal= {arXiv preprint arXiv:2508.18859},
year = {2025}
}