中文

面向开放词汇稠密预测的无偏区域-语言对齐

计算机视觉与模式识别 2025-12-25 v4

摘要

预训练视觉-语言模型 (VLM) 如 CLIP 在零样本识别任务中展现出惊人的能力,但在稠密预测任务中仍表现不足。自蒸馏方法日益成为通过无需大量标注来使 VLM 更好地适应局部区域的可行方法。然而,过去的 SOTA 方法常常受到显著的“前景偏置”,即模型倾向于将背景区域错误地识别为前景物体。为缓解此问题,我们提出 DenseVLM,一个旨在从强大的预训练 VLM 表示中学习无偏区域-语言对齐的框架。DenseVLM 利用预训练 VLM 检索未标记区域的类别,然后解耦前景和背景特征之间的干扰。我们展示了 DenseVLM 可直接取代原始 VLM,以用于开放词汇目标检测和图像分割方法,从而带来显著的性能提升。此外,它在训练更广泛和多样化数据集时展现出有前景的零样本可扩展性。我们的代码已公开于 https://github.com/HVision-NKU/DenseVLM。

关键词

引用

@article{arxiv.2412.06244,
  title  = {Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction},
  author = {Yunheng Li and Yuxuan Li and Quansheng Zeng and Wenhai Wang and Qibin Hou and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:2412.06244},
  year   = {2025}
}

备注

Accepted at ICCV 2025. The code is available at https://github.com/HVision-NKU/DenseVLM