SWIFT:基于滑动窗口重建的无需训练的少样本生成视频归因
计算机视觉与模式识别
2026-03-24 v2
摘要
近期视频生成技术的快速发展推动了其在多个领域的广泛应用。然而,对生成内容潜在滥用问题的担忧日益增长。追溯生成视频的来源对于缓解潜在滥用并识别责任方至关重要。现有视频归因方法需要额外的操作或训练源归因模型,这可能降低视频质量或需要大量训练样本。为解决这些挑战,我们首次定义了“少样本无需训练的生成视频归因”任务,并提出了SWIFT方法,该方法紧密集成了视频的时序特征。通过在每个视频块内利用“像素帧(多个)到潜在帧(一个)”的时序映射,SWIFT应用固定长度的滑动窗口执行两种不同的重建:正常重建和损坏重建。两种重建之间损失的差异被用作归因信号。我们对五种最先进(SOTA)视频生成模型进行了广泛评估。实验结果表明,SWIFT在所有模型上仅使用20个视频样本即可实现90%以上的平均归因准确率,甚至能够对HunyuanVideo、EasyAnimate和 Wan2.2实现零样本归因。我们的源代码已公开:https://github.com/wangchao0708/SWIFT。
引用
@article{arxiv.2603.08536,
title = {SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution},
author = {Chao Wang and Zijin Yang and Yaofei Wang and Yuang Qi and Weiming Zhang and Nenghai Yu and Kejiang Chen},
journal= {arXiv preprint arXiv:2603.08536},
year = {2026}
}
备注
8 pages. Accepted by CVPR 2026