中文

探索视觉情境学习中的任务级最优提示

人工智能 2025-01-16 v1 计算机视觉与模式识别

摘要

随着近年来视觉基础模型(VFM)的发展,视觉情境学习(VICL)已成为大多数场景下相较于修改模型更好的选择。不同于重新训练或微调模型,VICL 不需要修改模型的权重或架构,只需一个包含演示的提示即可教会 VFM 解决任务。当前,寻找每个测试样本的最优提示所需的计算成本较大,阻碍了 VICL 的部署,因为确定用于构建提示的哪些演示是非常昂贵的。在本文中,我们发现一种反直觉现象:实际上大多数测试样本在相同的提示下即可实现最佳性能,仅搜索样本级提示仅需更多时间却得不到完全相同的提示。因此,我们提出任务级提示以降低推理阶段搜索提示的成本,并引入两种节省时间且有效的任务级提示搜索策略。广泛的实验结果表明,我们的方法能够识别接近最优的提示,并以最小的成本实现最佳 VICL 性能,而此前的工作从未实现过。

关键词

引用

@article{arxiv.2501.08841,
  title  = {Exploring Task-Level Optimal Prompts for Visual In-Context Learning},
  author = {Yan Zhu and Huan Ma and Changqing Zhang},
  journal= {arXiv preprint arXiv:2501.08841},
  year   = {2025}
}