中文

单样本的力量:仅需一个示例即可实现视觉语言模型中的分割

计算机视觉与模式识别 2025-03-17 v1

摘要

大规模视觉语言模型(VLMs)通过在大量图像-文本对数据集上训练,展现出强大的多模态理解能力,这种能力隐式地学习了文本描述与图像区域之间的关联。这种新兴能力使得零样本目标检测和分割成为可能,无需依赖大量标记的分割数据集,即可通过基于文本-图像注意力图的技术实现。然而,这类方法的性能高度依赖于提示工程以及手动选择的注意力层或头的组合。在本工作中,我们证明了不必仅依赖文本提示,通过为每个类别提供单个视觉示例并对文本到图像的注意力层和嵌入进行微调,即可显著提升性能。此外,我们提出了通过少量样本微调多个层或提示的集成学习方法。我们提出了基于熵的文本到图像注意力层排序与选择机制,以无需分割标签的方式识别表现最佳的层,从而消除文本到图像注意力层超参数选择的需求,为开放词汇分割提供更灵活、可扩展的解决方案。我们展示,该方法可实现强大的零样本性能,微调单个视觉示例后进一步提升。此外,我们证明了本方法和发现具有普适性,可应用于各种视觉语言模型(VLMs)。

关键词

引用

@article{arxiv.2503.10779,
  title  = {The Power of One: A Single Example is All it Takes for Segmentation in VLMs},
  author = {Mir Rayat Imtiaz Hossain and Mennatullah Siam and Leonid Sigal and James J. Little},
  journal= {arXiv preprint arXiv:2503.10779},
  year   = {2025}
}