中文

VideoGuide:通过老师的指引提升视频扩散模型性能(无需训练)

计算机视觉与模式识别 2024-12-10 v3 人工智能 机器学习

摘要

文本到图像(T2I)扩散模型已彻底革新了视觉内容创建,但将这些能力扩展到文本到视频(T2V)生成仍是一个挑战,尤其是在保持时间一致性方面。现有方法往往在改善一致性的同时,会牺牲图像质量或计算时间不可行。为此,我们引入VideoGuide,一种新型框架,通过在推理早期阶段利用任何预训练视频扩散模型(VDM)或本模型作为指引,改进视频扩散模型的时间一致性,而无需额外训练或微调。通过将指导模型的去噪样本插值到采样模型的去噪过程中,提出的方法显著提高了时间一致性和图像保真度,提供了一种高性价比且实用的解决方案,综合了各种视频扩散模型的优势。进一步,我们演示了蒸馏技术,表明基础模型可通过利用指导模型的优势数据先验来实现更好的文本连贯性。项目页面:https://dohunlee1.github.io/videoguide.github.io/

关键词

引用

@article{arxiv.2410.04364,
  title  = {VideoGuide: Improving Video Diffusion Models without Training Through a Teacher's Guide},
  author = {Dohun Lee and Bryan S Kim and Geon Yeong Park and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2410.04364},
  year   = {2024}
}

备注

26 pages, 19 figures, Project Page: https://dohunlee1.github.io/videoguide.github.io/