Florence-2:推进面向多种视觉任务的统一表示
计算机视觉与模式识别
2023-11-13 v1
摘要
我们提出 Florence-2,一种新颖的视觉基础模型,采用统一的、基于提示的表示来处理多种计算机视觉与视觉-语言任务。尽管现有的大型视觉模型在迁移学习中表现出色,但它们难以用简单指令执行多样化任务,而这一能力意味着要处理不同空间层次与语义粒度所带来的复杂性。Florence-2 被设计为以文本提示作为任务指令,并以文本形式生成所需结果,无论是图像描述、目标检测、定位还是分割。这种多任务学习设定需要大规模、高质量的标注数据。为此,我们共同开发了 FLD-5B,其包含对 1.26 亿张图像的 54 亿条全面视觉标注,采用自动图像标注与模型精炼的迭代策略。我们采用序列到序列结构来训练 Florence-2 执行通用且全面的视觉任务。在大量任务上的广泛评测表明,Florence-2 是一个强劲的视觉基础模型竞争者,具备前所未有的零样本与微调能力。
引用
@article{arxiv.2311.06242,
title = {Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks},
author = {Bin Xiao and Haiping Wu and Weijian Xu and Xiyang Dai and Houdong Hu and Yumao Lu and Michael Zeng and Ce Liu and Lu Yuan},
journal= {arXiv preprint arXiv:2311.06242},
year = {2023}
}