迈向生成式与判别式视觉基础模型的统一:综述
计算机视觉与模式识别
2023-12-19 v1 机器学习
摘要
基础模型的出现,即在海量数据集上进行预训练的模型,开启了计算机视觉的新纪元,其特征是鲁棒性和卓越的零样本泛化能力。正如大型语言模型 (LLMs) 在自然语言处理领域产生的变革性影响一样,视觉基础模型 (VFMs) 已成为计算机视觉突破性发展的催化剂。本综述论文 delineates 了 VFMs 的关键发展轨迹,强调其在文本到图像合成等生成任务中的可扩展性和熟练度,以及在图像分割等判别任务中的娴熟能力。虽然生成式和判别式模型历史上一直沿着不同的路径发展,但我们对 VFMs 在这两个领域的最新进展进行了全面考察,阐明了它们的起源、开创性突破和关键方法论。此外,我们收集并讨论了促进 VFMs 开发的广泛资源,并解决了为未来研究工作铺平道路的挑战。未来的一个关键创新方向是生成式和判别式范式的融合。生成式模型在判别式语境中的初步应用标志着这种汇合的早期阶段。本综述旨在成为学者和从业者的当代指南,描绘 VFMs 的发展路线并阐明其多面化的景观。
引用
@article{arxiv.2312.10163,
title = {Towards the Unification of Generative and Discriminative Visual Foundation Model: A Survey},
author = {Xu Liu and Tong Zhou and Yuanxin Wang and Yuping Wang and Qinjingwen Cao and Weizhi Du and Yonghuan Yang and Junjun He and Yu Qiao and Yiqing Shen},
journal= {arXiv preprint arXiv:2312.10163},
year = {2023}
}