中文

面向视觉自回归生成的测试时扩展框架 TTS-VAR

计算机视觉与模式识别 2025-10-13 v2

摘要

扩大视觉生成模型的规模对于实际内容创建至关重要,但需要巨大的训练和计算开销。或者,测试时扩展因资源效率和前景性能而日益受到关注。在本工作中,我们提出了 TTS-VAR,即首个面向视觉自回归(VAR)模型的通用测试时扩展框架,將生成过程建模为路径搜索问题。為在计算效率和探索能力之間動態平衡,我們首先引入了在因果生成過程中逐步調整的自適應批量大小方案。此外,靈感來自 VAR 的階層粗到細多尺度生成,我們的框架整合了兩個關鍵組件:(i) 在粗尺度上,我們注意到生成的标记难以评估,可能導致對較差樣本的錯誤接受或對較好樣本的錯誤拒絕。注意到粗尺度包含足夠的結構信息,我們提出基於聚類的多樣性搜索。它透過語意特徵聚類保留結構多樣性,啟用後期對潛力更高的樣本選擇。(ii) 在細尺度上,基於重抽樣的潛力選擇使用潛力分數優先選擇有前景的候選者,這些分數定義為納入多尺度生成歷史的獎勵函數。在強大的 VAR 模型 Infinity 上實驗,顯示出 8.7% 的 GenEval 分數提升(從 0.69 提升至 0.75)。關鍵洞察揭示,早期階段的結構特徵有效影響最終品質,且重抽樣效能在不同生成尺度上有所變化。代碼已公開於 https://github.com/ali-vilab/TTS-VAR。

关键词

引用

@article{arxiv.2507.18537,
  title  = {TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive Generation},
  author = {Zhekai Chen and Ruihang Chu and Yukang Chen and Shiwei Zhang and Yujie Wei and Yingya Zhang and Xihui Liu},
  journal= {arXiv preprint arXiv:2507.18537},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025