中文

视觉中的自回归模型:综述

机器学习 2024-11-12 v1 人工智能 计算与语言 计算机视觉与模式识别 声音 音频与语音处理

摘要

自回归建模在自然语言处理(NLP)领域取得了巨大成功。近期,自回归模型已成为计算机视觉领域的一个重要关注焦点,在生成高质量视觉内容方面表现出色。NLP 中的自回归模型通常基于子词标记进行操作。然而,计算机视觉中的表示策略可以在不同层级上有所差异,即像素级、标记级或尺度级,这反映了视觉数据相比语言的顺序结构所具有的多样性和层次性。本综述全面考察了应用于视觉的自回归模型文献。为了提高来自不同研究背景的研究人员的可读性,我们首先介绍视觉中的序列表示与建模基础。接下来,我们将视觉自回归模型的基本框架划分为三个通用子类别,包括基于像素、基于标记和基于尺度的模型,这取决于表示策略。随后,我们探讨自回归模型与其他生成模型之间的关联。此外,我们呈现了计算机视觉中自回归模型的多方面分类,包括图像生成、视频生成、3D 生成和多模态生成。我们还阐述了它们在多样化领域的应用,包括新兴领域如具身 AI 和 3D 医疗 AI,引用了约 250 篇相关参考文献。最后,我们指出了自回归模型在视觉领域面临的当前挑战,并提出了潜在研究方向的建议。我们还建立了一个 GitHub 代码库来整理本综述中包含的论文,地址为:https://github.com/ChaofanTao/Autoregressive-Models-in-Vision-Survey。

关键词

引用

@article{arxiv.2411.05903,
  title  = {Towards Multi-Modal Mastery: A 4.5B Parameter Truly Multi-Modal Small Language Model},
  author = {Ben Koska and Mojmír Horváth},
  journal= {arXiv preprint arXiv:2411.05903},
  year   = {2024}
}