中文

CoT4Det:面向感知型视觉语言任务的思维链框架

计算机视觉与模式识别 2025-12-09 v1

摘要

大型视觉语言模型(LVLMs)在广泛的视觉语言任务中展示了显著的成功,例如通用视觉问答和光学字符识别(OCR)。然而,它们在感知中心型任务上的表现——如目标检测、语义分割和深度估计——仍然显著逊于任务专用专家模型。例如,Qwen2.5-VL-7B-Instruct 在 COCO2017 val 上仅达到 19% mAP,尤其在密集场景和小目标召回方面存在困难。在本工作中,我们引入了面向检测的思维链(CoT4Det),这是一种简单而高效的策略,将感知任务重新表述为三个可解释的步骤:分类、计数和定位——每个步骤都更自然地契合 LVLMs 的推理能力。大量实验表明,我们的方法显著提升了感知性能,同时不损害通用视觉语言能力。使用标准的 Qwen2.5-VL-7B-Instruct,CoT4Det 将 COCO2017 val 上的 mAP 从 19.0% 提升至 33.0%,并在多种感知基准测试上取得了具有竞争力的结果,在 RefCOCO 系列上超越基线 2%,在 Flickr30k entities 上超越基线 19%。

关键词

引用

@article{arxiv.2512.06663,
  title  = {CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks},
  author = {Yu Qi and Yumeng Zhang and Chenting Gong and Xiao Tan and Weiming Zhang and Wei Zhang and Jingdong Wang},
  journal= {arXiv preprint arXiv:2512.06663},
  year   = {2025}
}