LatentWarp:用于零样本视频到视频翻译的一致扩散隐变量
计算机视觉与模式识别
2023-11-02 v1
摘要
利用图像扩散模型的生成能力为零样本视频到视频翻译提供了巨大潜力。关键在于如何通过图像扩散模型在生成的视频帧之间保持时间一致性。先前的方法通常采用跨帧注意力,即在不同帧的注意力间共享键(key)与值(value)令牌,以促进时间一致性。然而,在这些工作中,时间不一致问题可能未得到彻底解决,导致生成视频的保真度受限。在本文中,我们发现瓶颈在于不受约束的查询(query)令牌,并提出了一种名为 LatentWarp 的新的零样本视频到视频翻译框架。我们的方法很简单:为约束查询令牌在时间上一致,我们进一步在隐空间引入扭曲(warp)操作以约束查询令牌。具体而言,基于从原始视频获取的光流,我们在去噪过程中将上一帧生成的隐特征扭曲以与当前帧对齐。由此,相邻帧的对应区域可共享紧密相关的查询令牌与注意力输出,从而进一步提升隐变量级一致性,增强生成视频的视觉时间连贯性。大量实验结果表明,LatentWarp 在实现具有时间连贯性的视频到视频翻译方面具有优越性。
引用
@article{arxiv.2311.00353,
title = {LatentWarp: Consistent Diffusion Latents for Zero-Shot Video-to-Video Translation},
author = {Yuxiang Bao and Di Qiu and Guoliang Kang and Baochang Zhang and Bo Jin and Kaiye Wang and Pengfei Yan},
journal= {arXiv preprint arXiv:2311.00353},
year = {2023}
}