ARINAR: 双层自回归逐特征生成模型
计算机视觉与模式识别
2025-03-05 v1
摘要
现有的自回归(AR)图像生成模型采用逐标记生成方案。即,它们预测每个标记的概率分布并从该分布中采样下一个标记。主要挑战在于如何建模高维标记的复杂分布。先前的方法要么过于简单而无法拟合该分布,要么导致生成速度缓慢。我们没有拟合所有标记的分布,而是探索使用自回归模型以逐特征的方式生成每个标记,即以已生成的特征作为输入并生成下一个特征。基于此,我们提出了 ARINAR(AR-in-AR),一个双层自回归模型。外层自回归层以前续标记为输入,预测下一个标记的条件向量 z。内层层在条件 z 下,自回归地生成下一个标记的特征。通过这种方式,内层层只需要建模单个特征的分布,例如使用简单的高斯混合模型。在 ImageNet 256×256 图像生成任务上,ARINAR-B 以 213M 参数实现了 FID=2.75,与最先进 MAR-B 模型(FID=2.31)相当,而速度是后者的五倍。
引用
@article{arxiv.2503.02883,
title = {ARINAR: Bi-Level Autoregressive Feature-by-Feature Generative Models},
author = {Qinyu Zhao and Stephen Gould and Liang Zheng},
journal= {arXiv preprint arXiv:2503.02883},
year = {2025}
}
备注
Technical report. Our code is available at https://github.com/Qinyu-Allen-Zhao/Arinar