LatSearch:基于隐奖励的视频扩散推理时间加速搜索
计算机视觉与模式识别
2026-03-17 v1
摘要
最近的推理时间放大在大型语言模型中的成功激发了类似探索在视频扩散中的应用。具体而言,受“黄金噪声”提升视频质量的启发,先前工作尝试通过优化或搜索更好的初始噪声来改进推理。然而,这些方法存在显著局限:要么依赖于噪声采样开始时的先验,要么仅在去噪解码视频上评估奖励。这导致误差累积、奖励信号延迟稀疏以及计算成本昂贵,阻碍了更强搜索算法的使用。关键的是,更强的搜索算法正是能够在视频扩散中实现显著提升可控性、样本效率和生成质量的关键,前提是其计算成本可被降低。为填补这一空白,我们通过隐奖励引导实现了视频扩散的高效推理时间放大,隐奖励提供沿去噪轨迹的中间、信息丰富且高效的反馈。我们引入一个隐奖励模型,用于对任意时刻部分去噪隐层在视觉质量、运动质量和文本对齐方面进行评分。基于该模型,我们提出LatSearch,一种新的推理时间搜索机制,执行奖励引导的重采样与修剪(RGRP)。在重采样阶段,依据奖励归一化概率采样候选方案,以减少对奖励模型的过度依赖。在修剪阶段,应用在最终预定步骤上,仅保留累积奖励最高的候选方案,从而提升质量与效率。我们在 VBench-2.0 基准测试上评估 LatSearch,证明其在多个评估维度上持续优于基线 Wan2.1 模型。
引用
@article{arxiv.2603.14526,
title = {LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion},
author = {Zengqun Zhao and Ziquan Liu and Yu Cao and Shaogang Gong and Zhensong Zhang and Jifei Song and Jiankang Deng and Ioannis Patras},
journal= {arXiv preprint arXiv:2603.14526},
year = {2026}
}
备注
Project page: see https://zengqunzhao.github.io/LatSearch