面向开放词汇稠密预测的无偏区域-语言对齐
计算机视觉与模式识别
2025-12-25 v4
摘要
预训练视觉-语言模型 (VLM) 如 CLIP 在零样本识别任务中展现出惊人的能力,但在稠密预测任务中仍表现不足。自蒸馏方法日益成为通过无需大量标注来使 VLM 更好地适应局部区域的可行方法。然而,过去的 SOTA 方法常常受到显著的“前景偏置”,即模型倾向于将背景区域错误地识别为前景物体。为缓解此问题,我们提出 DenseVLM,一个旨在从强大的预训练 VLM 表示中学习无偏区域-语言对齐的框架。DenseVLM 利用预训练 VLM 检索未标记区域的类别,然后解耦前景和背景特征之间的干扰。我们展示了 DenseVLM 可直接取代原始 VLM,以用于开放词汇目标检测和图像分割方法,从而带来显著的性能提升。此外,它在训练更广泛和多样化数据集时展现出有前景的零样本可扩展性。我们的代码已公开于 https://github.com/HVision-NKU/DenseVLM。
引用
@article{arxiv.2412.06244,
title = {Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction},
author = {Yunheng Li and Yuxuan Li and Quansheng Zeng and Wenhai Wang and Qibin Hou and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2412.06244},
year = {2025}
}
备注
Accepted at ICCV 2025. The code is available at https://github.com/HVision-NKU/DenseVLM