大规模图像与视频的通用物体基础模型
计算机视觉与模式识别
2023-12-15 v1
摘要
我们在本工作中提出了 GLEE,这是一种用于在图像和视频中定位及识别物体的物体级基础模型。通过一个统一的框架,GLEE 在开放世界场景中实现了任意物体的检测、分割、跟踪、定位和识别,适用于各种物体感知任务。采用协同学习策略,GLEE 从具有不同监督水平的多样化数据源中获取知识,以构建通用物体表示,在零样本迁移到新数据和新任务方面表现出色。具体而言,我们采用图像编码器、文本编码器和视觉提示器来处理多模态输入,从而能够同时解决各种以物体为中心的下游任务,同时保持最先进的性能。通过对来自不同基准的超过五百万张图像进行广泛训练,GLEE 展现了卓越的多样性和改进的泛化性能,无需特定任务适配即可高效处理下游任务。通过整合大量自动标注的数据,我们进一步增强了其零样本泛化能力。此外,GLEE 能够集成到大语言模型中,作为基础模型为多模态任务提供通用的物体级信息。我们希望我们方法的多样性和通用性将成为开发用于 AGI 系统的高效视觉基础模型的重要一步。模型和代码将在 https://glee-vision.github.io 发布。
引用
@article{arxiv.2312.09158,
title = {General Object Foundation Model for Images and Videos at Scale},
author = {Junfeng Wu and Yi Jiang and Qihao Liu and Zehuan Yuan and Xiang Bai and Song Bai},
journal= {arXiv preprint arXiv:2312.09158},
year = {2023}
}
备注
Project homepage: https://glee-vision.github.io