中文

Matcher:利用通用特征匹配以单样本分割一切

计算机视觉与模式识别 2024-01-22 v2

摘要

依托大规模预训练,视觉基础模型在开放世界图像理解中展现出显著潜力。然而,不同于擅长直接处理各类语言任务的大语言模型,视觉基础模型需要特定任务模型结构并在特定任务上微调。本工作中,我们提出 Matcher,一种利用现成视觉基础模型解决多种感知任务的新范式。Matcher 可使用上下文示例而无须训练即可分割一切。此外,我们在 Matcher 框架内设计了三个有效组件,与这些基础模型协作并在多样感知任务中释放其全部潜力。Matcher 在各种分割任务上展现出令人印象深刻的泛化性能,且均无须训练。例如,它在 COCO-20i^i 上以单样本取得 52.7% mIoU,超越最先进专用模型 1.6%。此外,Matcher 在提出的 LVIS-92i^i 单样本语义分割上取得 33.0% mIoU,优于最先进通才模型 14.4%。我们的可视化结果进一步展示了 Matcher 应用于自然图像时的开放世界通用性与灵活性。代码见 https://github.com/aim-uofa/Matcher。

关键词

引用

@article{arxiv.2305.13310,
  title  = {Matcher: Segment Anything with One Shot Using All-Purpose Feature Matching},
  author = {Yang Liu and Muzhi Zhu and Hengtao Li and Hao Chen and Xinlong Wang and Chunhua Shen},
  journal= {arXiv preprint arXiv:2305.13310},
  year   = {2024}
}

备注

Accepted to ICLR2024