中文

通过提示对任意事物进行分词

计算机视觉与模式识别 2024-07-18 v2

摘要

我们提出了一个统一的、可提示的模型,能够同时分割、识别和描述任何事物。与SAM不同,我们旨在通过视觉提示构建通用的区域表示。为此,我们使用大规模分割掩码(例如SA-1B掩码)和来自预训练的5B参数CLIP模型的语义先验来训练一个可泛化的模型。具体来说,我们通过向每个掩码令牌添加一个语义令牌来构建一个可提示的图像解码器。语义令牌负责在预定义的概念空间中学习语义先验。通过对掩码令牌的分割和语义令牌的概念预测进行联合优化,我们的模型展现出强大的区域识别和定位能力。例如,一个从头训练的额外38M参数因果文本解码器在Visual Genome区域描述任务上以164.7的CIDEr分数创造了新纪录。我们相信这个模型可以成为一个通用的区域级图像分词器,能够为广泛的视觉感知任务编码通用区域上下文。代码和模型可在https://github.com/baaivision/tokenize-anything获取。

关键词

引用

@article{arxiv.2312.09128,
  title  = {Tokenize Anything via Prompting},
  author = {Ting Pan and Lulu Tang and Xinlong Wang and Shiguang Shan},
  journal= {arXiv preprint arXiv:2312.09128},
  year   = {2024}
}

备注

code, model, and demo: https://github.com/baaivision/tokenize-anything