中文

视觉中的自回归模型:综述

计算机视觉与模式识别 2025-06-03 v2 计算与语言

摘要

自回归建模在自然语言处理(NLP)领域取得了巨大成功。近期,自回归模型在计算机视觉中成为一个重要研究方向,表现出在生成高质量视觉内容方面的优势。NLP中的自回归模型通常 operate on 子词 token。然而,计算机视觉中的表示策略可以在不同的层次上变化,即像素级、token 级或尺度级,这反映了视觉数据相对于语言序列结构的多样性和层次性。本综述全面考察了应用于视觉的自回归模型文献。为提高不同研究背景的研究者可读性,我们首先从视觉中的序列表示和建模入手。接着,我们根据表示策略,将视觉自回归模型的基本框架分为三大类,即基于像素的、基于 token 的和基于尺度的模型。我们进一步探讨了自回归模型与其他生成模型之间的相互关系。此外,我们对计算机视觉中的自回归模型进行了多维度分类,包括图像生成、视频生成、3D 生成和多模态生成。我们也详细阐述了这些模型在各个领域的应用,包括诸如具身 AI 和 3D 医学 AI 等新兴领域,约有 250 篇相关文献。最后,我们指出了视觉中自回归模型的当前挑战,并就潜在的研究方向提出了建议。我们还建立了一个 GitHub 仓库来组织本综述所收录的论文:https://github.com/ChaofanTao/Autoregressive-Models-in-Vision-Survey

关键词

引用

@article{arxiv.2411.05902,
  title  = {Autoregressive Models in Vision: A Survey},
  author = {Jing Xiong and Gongye Liu and Lun Huang and Chengyue Wu and Taiqiang Wu and Yao Mu and Yuan Yao and Hui Shen and Zhongwei Wan and Jinfa Huang and Chaofan Tao and Shen Yan and Huaxiu Yao and Lingpeng Kong and Hongxia Yang and Mi Zhang and Guillermo Sapiro and Jiebo Luo and Ping Luo and Ngai Wong},
  journal= {arXiv preprint arXiv:2411.05902},
  year   = {2025}
}

备注

The paper is accepted by TMLR