CoT-PL:面向开放词汇目标检测的链条思维伪标签
计算机视觉与模式识别
2026-03-19 v3
摘要
开放词汇目标检测(OVDD)旨在识别并局部化训练集之外的对象类别。最近的研究方法利用视觉语言模型生成伪标签,基于图像-文本对齐,使检测器能够在无显式监督的情况下泛化到未见类别。然而,这些方法高度依赖单步图像-文本匹配,忽略了解释语义复杂视觉情境(如拥挤或遮挡)所必需的中间推理步骤。本文引入 CoT-PL,一个将视觉链条思维推理纳入开放词汇目标检测伪标签过程的框架。它将复杂场景理解分解为三个可解释步骤——目标局部化、类别识别和背景 grounding——其中这些中间推理状态作为丰富的监督来源。大量实验在标准 OVD 评估协议下表明,CoT-PL 在伪标签效率方面实现了最先进的性能,在 OV-COCO 上以 novel classes 超过 9.4 AP50 提升,在 OV-LVIS 上分别在 box 和 mask APr 上提升 3.2 和 2.2。代码和模型可在 https://github.com/hchoi256/cotpl 获取。
引用
@article{arxiv.2510.14792,
title = {CoT-PL: Chain-of-Thought Pseudo-Labeling for Open-Vocabulary Object Detection},
author = {Hojun Choi and Youngsun Lim and Jaeyo Shin and Hyunjung Shim},
journal= {arXiv preprint arXiv:2510.14792},
year = {2026}
}
备注
38 pages, 15 Figures, 12 Tables