样本与参数高效自回归图像模型
种群与进化
2025-10-30 v1 机器学习
摘要
我们引入 XTRA,一种采用新颖自回归目标的视觉模型,显著提升了相较于以往自回归图像模型的样本和参数效率。与对比或掩码图像建模方法不同,后者在不平衡的互联网数据上未显示出一致的扩展行为,而自回归视觉模型随模型和数据集大小的增加表现出可扩展且有前景的性能。与标准自回归模型不同,XTRA 采用块因果掩码,其中每个 Block 表示 k k 个标记,而非依赖标准因果掩码。通过块级重构像素值,XTRA 捕获更大图像区域上的高层次结构模式。预测块允许模型学习更广区域像素之间的关系,实现比传统 next-token 预测更抽象且语义更丰富的表示。这种简单修改产生了两个关键结果:首先,XTRA 具有样本效率。尽管在样本数上仅为前一最先进自回归模型的 1/152(13.1M vs. 2B),XTRA ViT-H/14 在 15 个多样化图像识别基准测试中超越了前一最先进自回归模型的 top-1 平均准确率。其次,XTRA 具有参数效率。相较于在 ImageNet-1k 上训练的自回归模型,XTRA ViT-B/16 在线性和注意力探针任务中表现更好,使用的参数为前者的 1/7 至 1/16(85M vs. 1.36B/0.63B)。
引用
@article{arxiv.2411.15647,
title = {Circuit design in biology and machine learning. II. Anomaly detection},
author = {Steven A. Frank},
journal= {arXiv preprint arXiv:2411.15647},
year = {2025}
}