中文

Track4Gen:教会视频扩散模型进行点跟踪以提升视频生成

计算机视觉与模式识别 2025-04-08 v3 人工智能 机器学习

摘要

虽然最近的基础视频生成器能够产生视觉丰富的输出,但它们仍在外观漂移方面存在挑战,即对象在跨帧中逐渐退化或不一致地变化,破坏了视觉连贯性。我们假设,这是由于在特征层面缺乏明确的空间跟踪监督所致。我们提出Track4Gen,一种具有空间感知能力的视频生成器,将视频扩散损失与跨帧点跟踪相结合,为扩散特征提供增强的空间监督。Track4Gen通过对现有视频生成架构进行最小修改,将视频生成和点跟踪任务合并到单个网络中。以Stable Video Diffusion为骨干网络,Track4Gen展示了在通常被视为独立任务的情况下统一视频生成和点跟踪的可能性。我们的广泛评估表明,Track4Gen有效减少了外观漂移,实现了时序稳定和视觉连贯的视频生成。项目页面:hyeonho99.github.io/track4gen

关键词

引用

@article{arxiv.2412.06016,
  title  = {Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation},
  author = {Hyeonho Jeong and Chun-Hao Paul Huang and Jong Chul Ye and Niloy Mitra and Duygu Ceylan},
  journal= {arXiv preprint arXiv:2412.06016},
  year   = {2025}
}

备注

CVPR 2025, Project page: hyeonho99.github.io/track4gen