全视项目:面向开放世界全景视觉识别与理解
计算机视觉与模式识别
2023-08-04 v1
摘要
我们提出全视(All-Seeing,AS)项目:一个用于识别和理解开放世界中一切事物的大规模数据与模型。利用可扩展的数据引擎,将人类反馈与高效模型纳入循环,我们构建了一个新数据集(AS-1B),其中包含超过 10 亿个带有语义标签、问答对和详细描述字幕的区域标注。它涵盖了现实世界中 350 万个常见与罕见概念的广泛范围,并拥有 1322 亿个描述这些概念及其属性的词元(token)。基于该新数据集,我们开发了全视模型(ASM),一个用于全景视觉识别与理解的统一框架。该模型以开放式语言提示和位置进行训练,使其能够以卓越的零样本性能泛化到各类视觉与语言任务,包括区域-文本检索、区域识别、图像描述生成和问答。我们希望该项目能作为视觉-语言通用人工智能研究的基础。模型和数据集将于 https://github.com/OpenGVLab/All-Seeing 发布,演示可参见 https://huggingface.co/spaces/OpenGVLab/all-seeing。
引用
@article{arxiv.2308.01907,
title = {The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World},
author = {Weiyun Wang and Min Shi and Qingyun Li and Wenhai Wang and Zhenhang Huang and Linjie Xing and Zhe Chen and Hao Li and Xizhou Zhu and Zhiguo Cao and Yushi Chen and Tong Lu and Jifeng Dai and Yu Qiao},
journal= {arXiv preprint arXiv:2308.01907},
year = {2023}
}
备注
Technical Report