中文

FocalLens:通过指令调优实现零-shot 条件图像表征

计算机视觉与模式识别 2025-04-14 v1 计算与语言 机器学习

摘要

视觉理解是内在具备语境性的——我们对图像中关注的内容取决于具体任务。例如,给定一张包含持花束的人员照片,我们可能关注人物(如其服装),也可能关注花的种类,这取决于感兴趣的语境。然而,大多数现有的图像编码范式将图像表示为固定的、通用的特征向量,忽略了针对不同下游应用场景对视觉信息优先级不同这一潜在需求。本文引入FocalLens,这是一种条件视觉编码方法,能够根据感兴趣的语境(通过自然语言灵活表达),为同一图像生成不同的表征。我们利用视觉指令调优数据,对预训练视觉编码器进行对比式微调,使其能够将自然语言指令作为额外输入,以产生条件化的图像表征。广泛的实验验证表明,FocalLens生成的条件图像表征在突出感兴趣的视觉特征方面,优于来自诸如CLIP等标准视觉编码器所产生的通用特征。此外,我们展示FocalLens还能在图像-图像检索、图像分类和图像-文本检索等多项下游任务上取得性能提升,在具有挑战性的SugarCrepe和MMVP-VLM基准测试中分别获得平均提升5分和10分。

关键词

引用

@article{arxiv.2504.08368,
  title  = {FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations},
  author = {Cheng-Yu Hsieh and Pavan Kumar Anasosalu Vasu and Fartash Faghri and Raviteja Vemulapalli and Chun-Liang Li and Ranjay Krishna and Oncel Tuzel and Hadi Pouransari},
  journal= {arXiv preprint arXiv:2504.08368},
  year   = {2025}
}