ECO:面向视觉语言模型的上下文集成优化
计算机视觉与模式识别
2023-07-27 v1
摘要
图像识别近来经历了范式转变,视觉语言模型现被用于基于文本提示进行少样本分类。其中,CLIP模型通过在潜空间匹配图像与自定义文本提示,展现出卓越的零样本迁移能力。这为若干聚焦于设计或学习文本上下文以最大化CLIP分类能力的工作铺平了道路。本文顺应此趋势,通过学习一组用于图像分类的提示集成。我们表明,学习多样化且可能更短的上下文,相比依赖单一可训练提示,能大幅且稳定地改善结果。特别地,我们以推理时无额外开销报告了更好的少样本能力。我们在11个不同基准上展示了该方法的能力。
引用
@article{arxiv.2307.14063,
title = {ECO: Ensembling Context Optimization for Vision-Language Models},
author = {Lorenzo Agnolucci and Alberto Baldrati and Francesco Todino and Federico Becattini and Marco Bertini and Alberto Del Bimbo},
journal= {arXiv preprint arXiv:2307.14063},
year = {2023}
}