Free$^2$Guide:基于图像 LVLM 的无训练文本到视频对齐
计算机视觉与模式识别
2025-10-21 v2 人工智能
机器学习
摘要
扩散模型在文本到视频(T2V)合成任务中取得了令人瞩目的成绩。然而,由于跨帧之间复杂的时间依赖性,实现文本到视频生成的准确文本对齐仍然具有挑战性。现有的基于强化学习(RL)的方法往往需要针对视频训练的可微分奖励函数,这限制了其可扩展性和适用性。为此,本文提出一种名为 FreeGuide 的新型无梯度、无训练框架,用于将生成视频与文本提示进行对齐。具体而言,借助路径积分控制的原理,FreeGuide 使用非可微分的奖励函数近似扩散模型的引导,从而实现将强大的黑盒大型视觉语言模型(LVLMs)作为奖励模型集成。为使图像训练的 LVLMs 能够评估文本到视频对齐,我们利用视频帧之间的“拼接”(stitching)技术并使用系统提示词捕获序列属性。该框架支持灵活地组合多个奖励模型,以协同增强对齐效果,同时几乎没有额外的计算开销。实验结果表明,FreeGuide 使用图像训练的 LVLMs 能显著提高文本到视频对齐效果,从而提升整体视频质量。我们的研究成果和代码已在 https://kjm981995.github.io/free2guide/ 上公开。
引用
@article{arxiv.2411.17041,
title = {Free$^2$Guide: Training-Free Text-to-Video Alignment using Image LVLM},
author = {Jaemin Kim and Bryan Sangwoo Kim and Jong Chul Ye},
journal= {arXiv preprint arXiv:2411.17041},
year = {2025}
}
备注
ICCV 2025 accepted