迈向统一的关键帧传播模型
计算机视觉与模式识别
2022-05-20 v1
摘要
许多视频编辑任务(如 rotoscoping 或物体移除)需要跨帧传播上下文。尽管Transformer及其他基于注意力、全局聚合特征的方法在将物体掩码从关键帧传播至整个视频上已取得巨大成功,它们难以忠实传播纹理等高频细节。我们假设这源于全局注意力对低频特征的固有偏置。为克服该局限,我们提出双流方法:高频特征局部交互,低频特征全局交互。全局交互流在如大幅相机运动等显式对齐失效的困难情形下保持鲁棒。局部交互流通过可变形特征聚合传播高频细节,并受全局交互流引导,学习检测并纠正形变场的误差。我们在修复任务上评估双流方法,实验表明其既改善了图像修复所需的单帧内特征传播,也改善了从关键帧至目标帧的特征传播。应用于视频修复时,我们的方法在 FID 与 LPIPS 分数上分别带来 44% 与 26% 的提升。代码见 https://github.com/runwayml/guided-inpainting
引用
@article{arxiv.2205.09731,
title = {Towards Unified Keyframe Propagation Models},
author = {Patrick Esser and Peter Michael and Soumyadip Sengupta},
journal= {arXiv preprint arXiv:2205.09731},
year = {2022}
}
备注
CVPRW 2022 - AI for Content Creation Workshop. Code at https://github.com/runwayml/guided-inpainting