基于三维熵感知语义分析和稀疏性优化的高效视觉自回归建模
代数几何
2026-02-27 v1
摘要
视觉自回归(VAR)模型在提高生成质量方面发挥着关键作用,但在后期阶段面临效率瓶颈。本文提出了一种针对VAR模型的新型优化框架,与先前方法(如FastVAR和SkipVAR)在根本上存在差异。 our方法利用注意力熵来 characterize模型架构不同维度的语义投影。这enable了在不同token粒度水平、语义范围和生成规模下精确识别参数动态。基于此分析,我们进一步发现token、layer和scale三个关键维度上的稀疏性模式,并提出了针对这些模式的一组细粒度优化策略。广泛的评估表明,我们的方法在显著保持语义忠诚度和细节的同时实现了对生成过程的激进加速,在效率和质量方面均优于传统方法。在Infinity-2B和Infinity-8B模型上的实验表明,ToProVAR可实现最高3.4倍的加速,同时保持最小质量损失,有效缓解了先前工作中发现的问题。我们的代码将公开提供。
引用
@article{arxiv.2602.22947,
title = {On a conjecture of Fujino and Sato},
author = {Michele Rossi},
journal= {arXiv preprint arXiv:2602.22947},
year = {2026}
}
备注
6 pages, 2 figures