Chameleon:一种面向野外密集视觉预测的数据高效通才模型
计算机视觉与模式识别
2024-12-20 v3
摘要
大型语言模型得益于通用语言接口和大规模预训练,已进化为数据高效的通才。然而,为密集视觉预测构建一个数据高效的通才模型则面临独特的挑战,因为不同任务的标签结构存在差异。因此,在低数据量情况下泛化到未见过的密集预测任务并非易事,且此前较少受到视觉通才模型的关注。在本研究中,我们探索了一种通用模型,该模型能够通过少量示例灵活地适应未见过的密集标签结构,使其能够在多样化的现实世界场景中充当数据高效的视觉通才。为此,我们将方法建立在一个强大的元学习框架之上,并探索了多个维度以提升其在现实世界问题中的性能和通用性,例如灵活的适应机制和可扩展性。我们在一系列需要低样本学习的未见过的现实世界场景中评估了我们的模型,包括视频、3D、医学、生物和用户交互任务。凭借通用的架构和有效的适应机制,我们的模型最多使用50张带标签图像就能灵活地适应所有这些任务,相较于现有的数据高效通才方法取得了显著进步。代码可在https://github.com/GitGyun/chameleon获取。
引用
@article{arxiv.2404.18459,
title = {Chameleon: A Data-Efficient Generalist for Dense Visual Prediction in the Wild},
author = {Donggyun Kim and Seongwoong Cho and Semin Kim and Chong Luo and Seunghoon Hong},
journal= {arXiv preprint arXiv:2404.18459},
year = {2024}
}