中文

ImagerySearch:超越语义依赖约束的视频生成自适应测试时间搜索

计算机视觉与模式识别 2025-10-23 v2

摘要

视频生成模型取得了显著进展,尤其在逼真场景中表现突出;但在富有想象力的场景中性能明显下降。这些提示常涉及稀有共现概念及长距离语义关系,超出训练分布。现有方法通常应用测试时间扩张以提升视频质量,但其固定搜索空间和静态奖励设计限制了对富有想象力场景的适应性。为填补这一空白,我们提出了 ImagerySearch,一种引导式自适应测试时间搜索策略,动态调整推理搜索空间和奖励函数以适应提示中的语义关系。这使得在具有挑战性的富有想象力设置中能够生成更连贯、更具视觉可信度的视频。为评估此方向的进展,我们引入 LDT-Bench,即针对长距离语义提示的首个专项基准,包含 2,839 个多样化概念对及自动化的创意生成能力评估协议。大量实验表明,ImagerySearch 在 LDT-Bench 上持续优于强大的视频生成基线和现有测试时间扩张方法,在 VBench 上实现具有竞争力的提升,充分展示了在多样化提示类型下的有效性。我们将发布 LDT-Bench 和代码以推动未来在富有想象力的视频生成研究。

关键词

引用

@article{arxiv.2510.14847,
  title  = {ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints},
  author = {Meiqi Wu and Jiashu Zhu and Xiaokun Feng and Chubin Chen and Chen Zhu and Bingze Song and Fangyuan Mao and Jiahong Wu and Xiangxiang Chu and Kaiqi Huang},
  journal= {arXiv preprint arXiv:2510.14847},
  year   = {2025}
}