CoT4Det:面向感知型视觉语言任务的思维链框架
计算机视觉与模式识别
2025-12-09 v1
摘要
大型视觉语言模型(LVLMs)在广泛的视觉语言任务中展示了显著的成功,例如通用视觉问答和光学字符识别(OCR)。然而,它们在感知中心型任务上的表现——如目标检测、语义分割和深度估计——仍然显著逊于任务专用专家模型。例如,Qwen2.5-VL-7B-Instruct 在 COCO2017 val 上仅达到 19% mAP,尤其在密集场景和小目标召回方面存在困难。在本工作中,我们引入了面向检测的思维链(CoT4Det),这是一种简单而高效的策略,将感知任务重新表述为三个可解释的步骤:分类、计数和定位——每个步骤都更自然地契合 LVLMs 的推理能力。大量实验表明,我们的方法显著提升了感知性能,同时不损害通用视觉语言能力。使用标准的 Qwen2.5-VL-7B-Instruct,CoT4Det 将 COCO2017 val 上的 mAP 从 19.0% 提升至 33.0%,并在多种感知基准测试上取得了具有竞争力的结果,在 RefCOCO 系列上超越基线 2%,在 Flickr30k entities 上超越基线 19%。
引用
@article{arxiv.2512.06663,
title = {CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks},
author = {Yu Qi and Yumeng Zhang and Chenting Gong and Xiao Tan and Weiming Zhang and Wei Zhang and Jingdong Wang},
journal= {arXiv preprint arXiv:2512.06663},
year = {2025}
}