向后看:基于特征库的流式视频到视频翻译
计算机视觉与模式识别
2025-02-18 v3 多媒体
摘要
本文介绍了StreamV2V,一种扩散模型,能够根据用户提示实现实时流式视频到视频(V2V)翻译。与之前使用批次处理有限帧的V2V方法不同,我们选择以流式方式处理帧,以支持无限帧。StreamV2V的核心是一个向后看的原则,将现在与过去联系起来。这是通过维护一个特征库来实现的,该特征库存档来自过去帧的信息。对于传入的帧,StreamV2V将自注意力扩展到包括库中的键和值,并直接将相似的过去特征融合到输出中。特征库通过合并存储的和新的特征不断更新,使其紧凑但信息丰富。StreamV2V以其适应性和效率脱颖而出,无需微调即可无缝集成到图像扩散模型中。它可以在一个A100 GPU上以20 FPS运行,比FlowVid、CoDeF、Rerender和TokenFlow分别快15倍、46倍、108倍和158倍。定量指标和用户研究证实了StreamV2V在保持时间一致性方面的卓越能力。
引用
@article{arxiv.2405.15757,
title = {Looking Backward: Streaming Video-to-Video Translation with Feature Banks},
author = {Feng Liang and Akio Kodaira and Chenfeng Xu and Masayoshi Tomizuka and Kurt Keutzer and Diana Marculescu},
journal= {arXiv preprint arXiv:2405.15757},
year = {2025}
}
备注
ICLR 2025. Project page: https://jeff-liangf.github.io/projects/streamv2v