基于视觉令牌匹配的密集预测任务通用少样本学习
计算机视觉与模式识别
2023-03-28 v1 人工智能
摘要
密集预测任务是计算机视觉中的一类基本问题。由于监督方法的像素级标注成本高昂,人们期望有一种少样本学习方案,能从少量标注图像中学习任意密集任务。然而,当前的少样本学习方法仅针对语义分割等受限任务集,这可能是由于难以设计一个能够灵活、高效地适应未见语义的任意任务的通用统一模型。我们提出视觉令牌匹配(Visual Token Matching, VTM),一种面向任意密集预测任务的通用少样本学习器。它通过对图像与标签的块级嵌入令牌进行非参数匹配,封装了所有任务。此外,VTM 以少量任务特定参数灵活适应任意任务,这些参数对匹配算法进行调制。我们将 VTM 实现为一个强大的分层编码器-解码器架构,采用 ViT 骨干网络,在多个特征层级上执行令牌匹配。我们在 Taskonomy 数据集的一个具有挑战性的变体上实验 VTM,观察到它能稳健地少样本学习多种未见密集预测任务。令人惊讶的是,仅使用新任务 10 个标注样本(全监督的 0.004%)时,它便可与全监督基线相媲美,并在使用全监督 0.1% 样本时有时表现更优。代码见 https://github.com/GitGyun/visual_token_matching。
引用
@article{arxiv.2303.14969,
title = {Universal Few-shot Learning of Dense Prediction Tasks with Visual Token Matching},
author = {Donggyun Kim and Jinwoo Kim and Seongwoong Cho and Chong Luo and Seunghoon Hong},
journal= {arXiv preprint arXiv:2303.14969},
year = {2023}
}