中文

视觉自回归模型综述

计算机视觉与模式识别 2024-11-19 v2 人工智能

摘要

自回归模型在自然语言处理 (NLP) 中展现了卓越的性能,具有令人印象深刻的可扩展性、适应性和泛化能力。受其在 NLP 领域显著成功的启发,自回归模型最近在计算机视觉领域得到了深入研究,它们通过将视觉数据表示为视觉标记来执行下一个标记预测,并实现了广泛视觉任务的自回归建模,范围涵盖从视觉生成、视觉理解到最新的多模态生成,即用单一自回归模型统一视觉生成和理解。本文对视觉自回归模型进行了系统性综述,包括建立现有方法的分类体系并突出其主要贡献、优势和局限性,涵盖图像生成、视频生成、图像编辑、运动生成、医学图像分析、三维生成、机器人操作、统一多模态生成等各类视觉任务。此外,我们调查并分析了自回归模型的最新进展,包括跨各种评估数据集对现有方法的全面基准测试和讨论。最后,我们概述了关键挑战和未来研究的有前景方向,为视觉自回归模型的进一步发展提供了路线图。

关键词

引用

@article{arxiv.2411.08666,
  title  = {A Survey on Vision Autoregressive Model},
  author = {Kai Jiang and Jiaxing Huang},
  journal= {arXiv preprint arXiv:2411.08666},
  year   = {2024}
}

备注

This work will be integrated into another project