Florence:一种用于计算机视觉的新基础模型
计算机视觉与模式识别
2021-11-23 v1 人工智能
机器学习
摘要
对我们多样且开放世界的自动视觉理解要求计算机视觉模型在最少任务定制下良好泛化,类似于人类视觉。在计算机视觉基础模型上训练于多样、大规模数据集并可适配广泛下游任务,对于解决现实世界计算机视觉应用这一使命至关重要。尽管现有的视觉基础模型如CLIP、ALIGN和悟道2.0主要关注将图像和文本表示映射到跨模态共享表示,我们引入了一种新的计算机视觉基础模型Florence,以将表示从粗(场景)扩展到细(物体)、从静态(图像)到动态(视频)、从RGB到多模态(标题、深度)。通过融入来自Web规模图像-文本数据的通用视觉-语言表示,我们的Florence模型可轻松适配各类计算机视觉任务,如分类、检索、目标检测、VQA、图像描述、视频检索和动作识别。此外,Florence在许多类型的迁移学习中展现出卓越性能:全样本微调、线性探测、少样本迁移以及针对新图像和物体的零样本迁移。所有这些特性对于我们视觉基础模型服务通用视觉任务至关重要。Florence在44个代表性基准中的大多数上取得了新的最先进结果,例如在ImageNet-1K零样本分类上top-1准确率83.74、top-5准确率97.18,COCO微调上62.4 mAP,VQA上80.36,以及Kinetics-600上87.8。
引用
@article{arxiv.2111.11432,
title = {Florence: A New Foundation Model for Computer Vision},
author = {Lu Yuan and Dongdong Chen and Yi-Ling Chen and Noel Codella and Xiyang Dai and Jianfeng Gao and Houdong Hu and Xuedong Huang and Boxin Li and Chunyuan Li and Ce Liu and Mengchen Liu and Zicheng Liu and Yumao Lu and Yu Shi and Lijuan Wang and Jianfeng Wang and Bin Xiao and Zhen Xiao and Jianwei Yang and Michael Zeng and Luowei Zhou and Pengchuan Zhang},
journal= {arXiv preprint arXiv:2111.11432},
year = {2021}
}