中文

Chain-of-Caption:无需训练改进多模态大语言模型的指代表达理解

计算机视觉与模式识别 2026-02-10 v1

摘要

给定文本描述,指代表达理解(REC)任务涉及在图像中定位所指对象。多模态大语言模型(MLLM)通过扩大模型规模和训练数据,在REC基准测试中取得了高准确率。此外,使用思维链和工具使用等技术可以进一步提高MLLM的性能,这些技术为模型提供了额外的视觉或文本上下文。在本文中,我们分析了通过工具使用向MLLM提供额外视觉和文本上下文的各种技术及其对REC任务的影响。此外,我们提出了一个名为Chain-of-Caption的无需训练框架,以改进MLLM的REC性能。我们在RefCOCO/RefCOCOg/RefCOCO+和Ref-L4数据集上进行了实验,结果表明,无需任何微调,单独的文本或视觉上下文就能提高REC性能。通过结合多种上下文,我们的无需训练框架在不同交并比(IoU)阈值下的准确率上,相比基线模型显示出5%到30%的性能提升。

关键词

引用

@article{arxiv.2602.08211,
  title  = {Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension},
  author = {Yik Lung Pang and Changjae Oh},
  journal= {arXiv preprint arXiv:2602.08211},
  year   = {2026}
}

备注

4 pages, 5 figures, 2 tables