GenRec:利用扩散模型统一视频生成与识别
计算机视觉与模式识别
2024-11-13 v2
摘要
视频扩散模型能够通过在大规模数据集上学习强大的时空先验来生成高质量视频。在本文中,我们旨在研究源自生成过程的此类先验是否适用于视频识别,并最终实现生成与识别的联合优化。基于Stable Video Diffusion,我们引入了GenRec,这是第一个通过随机帧条件化过程训练的统一框架,以学习广义的时空表示。由此产生的框架自然支持生成和识别,更重要的是,即使在视觉输入包含有限信息时也具有鲁棒性。大量实验证明了GenRec在识别和生成方面的有效性。特别是,GenRec在SSV2和K400上分别达到了75.8%和87.2%的准确率,展现了具有竞争力的识别性能。GenRec在类别条件图像到视频生成方面也表现最佳,在SSV2和EK-100数据集上分别获得了46.5和49.3的FVD分数。此外,GenRec在只能观察到有限帧的场景中表现出非凡的鲁棒性。代码将在https://github.com/wengzejia1/GenRec提供。
引用
@article{arxiv.2408.15241,
title = {GenRec: Unifying Video Generation and Recognition with Diffusion Models},
author = {Zejia Weng and Xitong Yang and Zhen Xing and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2408.15241},
year = {2024}
}
备注
19 pages, 6 figures, 12 tables