面向上下文场景理解
计算机视觉与模式识别
2023-11-01 v2
摘要
上下文学习(in-context learning)——即通过不同提示配置模型行为的能力——已彻底变革自然语言处理领域,减少了对特定任务模型的需求,并为能够处理任意查询的通才模型铺平了道路。相比之下,计算机视觉大多仍停留在前一种范式:执行语义分割和深度估计等密集任务通常需要专门的 decoder 和微调协议。本工作中,我们探索了一种用于此类场景理解任务上下文学习的简单机制:从带标注特征的提示中进行最近邻检索。我们提出了一种新的预训练协议——利用图像内与跨图像的注意力——其产生的表示在该机制下尤为有用。由此得到的 Hummingbird 模型在适当提示下无需修改即可执行多种场景理解任务,同时逼近为每个任务微调的专家模型性能。此外,Hummingbird 可比微调模型更高效地被配置以执行新任务,提升了在交互式助手范式下进行场景理解的可能性。
引用
@article{arxiv.2306.01667,
title = {Towards In-context Scene Understanding},
author = {Ivana Balažević and David Steiner and Nikhil Parthasarathy and Relja Arandjelović and Olivier J. Hénaff},
journal= {arXiv preprint arXiv:2306.01667},
year = {2023}
}