中文

Perceive Anything:识别、解释、描述并对图像和视频中的任何东西进行分割

计算机视觉与模式识别 2025-06-06 v1

摘要

我们提出了Perceive Anything Model(PAM),一个概念简单且高效的框架,用于对图像和视频进行区域级别的综合视觉理解。我们的方案扩展了强大的分割模型SAM 2,通过集成大型语言模型(LLM),实现对象分割与生成多样化、区域特定语义输出的同时,包括类别、标签定义、功能解释和详细描述。关键组件Semantic Perceiver被引入,用于高效地将SAM 2的丰富视觉特征(这些特征本质上携带了通用视觉、局化和语义先验)转换为LLM能够理解的多模态标记。为支持鲁棒的多层次理解,我们还开发了一套专门的数据细化和数据增强管道,构建了包含150万张图像和60万条视频区域语义注释的高质量数据集,包括新颖的区域级别流式视频描述数据。PAM设计轻便高效,同时在多样化的区域理解任务中表现出色。相较于先前方法,它运行速度快1.2-2.4倍,消耗的GPU内存更少,为实际应用提供了实用解决方案。我们认为,这种有效的方法将为未来的区域级别视觉理解研究提供强大的基线。

关键词

引用

@article{arxiv.2506.05302,
  title  = {Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos},
  author = {Weifeng Lin and Xinyu Wei and Ruichuan An and Tianhe Ren and Tingwei Chen and Renrui Zhang and Ziyu Guo and Wentao Zhang and Lei Zhang and Hongsheng Li},
  journal= {arXiv preprint arXiv:2506.05302},
  year   = {2025}
}

备注

19 pages, 13 figures, Website: https://Perceive-Anything.github.io