Matcher:利用通用特征匹配以单样本分割一切
计算机视觉与模式识别
2024-01-22 v2
摘要
依托大规模预训练,视觉基础模型在开放世界图像理解中展现出显著潜力。然而,不同于擅长直接处理各类语言任务的大语言模型,视觉基础模型需要特定任务模型结构并在特定任务上微调。本工作中,我们提出 Matcher,一种利用现成视觉基础模型解决多种感知任务的新范式。Matcher 可使用上下文示例而无须训练即可分割一切。此外,我们在 Matcher 框架内设计了三个有效组件,与这些基础模型协作并在多样感知任务中释放其全部潜力。Matcher 在各种分割任务上展现出令人印象深刻的泛化性能,且均无须训练。例如,它在 COCO-20 上以单样本取得 52.7% mIoU,超越最先进专用模型 1.6%。此外,Matcher 在提出的 LVIS-92 单样本语义分割上取得 33.0% mIoU,优于最先进通才模型 14.4%。我们的可视化结果进一步展示了 Matcher 应用于自然图像时的开放世界通用性与灵活性。代码见 https://github.com/aim-uofa/Matcher。
引用
@article{arxiv.2305.13310,
title = {Matcher: Segment Anything with One Shot Using All-Purpose Feature Matching},
author = {Yang Liu and Muzhi Zhu and Hengtao Li and Hao Chen and Xinlong Wang and Chunhua Shen},
journal= {arXiv preprint arXiv:2305.13310},
year = {2024}
}
备注
Accepted to ICLR2024