中文

寻找视觉任务向量

计算机视觉与模式识别 2024-10-08 v2

摘要

视觉提示 是一种通过上下文示例教会模型执行视觉任务的技术,无需任何额外训练。在这项工作中,我们分析了最近的视觉提示模型 MAE-VQGAN 的激活,并发现了任务向量,即编码任务特定信息的激活。基于这一洞察,我们证明了可以识别任务向量并使用它们引导网络执行不同的任务,而无需提供任何输入-输出示例。为了寻找任务向量,我们计算每个任务的平均中间激活,并使用 REINFORCE 算法搜索任务向量的子集。由此产生的任务向量引导模型执行任务的效果优于原始模型,且无需输入-输出示例。

关键词

引用

@article{arxiv.2404.05729,
  title  = {Finding Visual Task Vectors},
  author = {Alberto Hojel and Yutong Bai and Trevor Darrell and Amir Globerson and Amir Bar},
  journal= {arXiv preprint arXiv:2404.05729},
  year   = {2024}
}

备注

https://github.com/alhojel/visual_task_vectors