中文

通过测试时进化搜索扩展图像与视频生成

计算机视觉与模式识别 2025-05-26 v1 人工智能 机器学习

摘要

随着模型预训练期间扩展计算(数据和参数)的边际成本持续大幅增加,测试时扩展(TTS)已成为通过在推理时分配额外计算来提升生成模型性能的有前景方向。虽然TTS在多个语言任务上已取得显著成功,但在图像和视频生成模型(基于扩散或基于流的模型)的测试时扩展行为方面仍存在显著理解空白。尽管近期工作已启动视觉任务的推理时策略探索,但这些方法面临关键局限:受限于特定任务领域、扩展性差,或陷入牺牲样本多样性的奖励过度优化。在本文中,我们提出进化搜索(EvoSearch),一种新颖、通用且高效的TTS方法,有效提升扩散和流模型在图像和视频生成中的扩展性,无需额外训练或模型扩展。EvoSearch将扩散和流模型的测试时扩展重新表述为进化搜索问题,利用生物进化原理高效探索和优化去噪轨迹。通过纳入针对随机微分方程去噪过程精心设计的选择和变异机制,EvoSearch迭代生成更高质量的后代同时保持种群多样性。在扩散和流架构的图像和视频生成任务上的广泛评估表明,我们的方法持续优于现有方法,实现更高多样性,并对 unseen 评估指标展现出强泛化能力。项目网站:https://tinnerhrhe.github.io/evosearch

关键词

引用

@article{arxiv.2505.17618,
  title  = {Scaling Image and Video Generation via Test-Time Evolutionary Search},
  author = {Haoran He and Jiajun Liang and Xintao Wang and Pengfei Wan and Di Zhang and Kun Gai and Ling Pan},
  journal= {arXiv preprint arXiv:2505.17618},
  year   = {2025}
}

备注

37 pages. Project: https://tinnerhrhe.github.io/evosearch