视觉-语言模型中的任务偏置
计算机视觉与模式识别
2022-12-09 v1 机器学习
摘要
来自语言的附带监督已成为学习通用视觉表征的流行方法,这些表征可被提示以执行计算机视觉中的许多识别任务。我们对 CLIP 模型进行了深入探究,表明其视觉表征往往强烈偏置于解决某些任务甚于其他任务。此外,表征将偏置于哪一任务是不可预测的,在图像间几乎无一致性。为解决此任务偏置,我们展示了如何学习一个视觉提示,将表征引导至与其感兴趣任务相关的特征。我们的结果表明,这些视觉提示可独立于输入图像,仍能有效提供一种调节机制,将视觉表征导向所需任务。
引用
@article{arxiv.2212.04412,
title = {Task Bias in Vision-Language Models},
author = {Sachit Menon and Ishaan Preetam Chandratreya and Carl Vondrick},
journal= {arXiv preprint arXiv:2212.04412},
year = {2022}
}
备注
First two authors contributed equally