Chain-of-Caption:无需训练改进多模态大语言模型的指代表达理解
计算机视觉与模式识别
2026-02-10 v1
摘要
给定文本描述,指代表达理解(REC)任务涉及在图像中定位所指对象。多模态大语言模型(MLLM)通过扩大模型规模和训练数据,在REC基准测试中取得了高准确率。此外,使用思维链和工具使用等技术可以进一步提高MLLM的性能,这些技术为模型提供了额外的视觉或文本上下文。在本文中,我们分析了通过工具使用向MLLM提供额外视觉和文本上下文的各种技术及其对REC任务的影响。此外,我们提出了一个名为Chain-of-Caption的无需训练框架,以改进MLLM的REC性能。我们在RefCOCO/RefCOCOg/RefCOCO+和Ref-L4数据集上进行了实验,结果表明,无需任何微调,单独的文本或视觉上下文就能提高REC性能。通过结合多种上下文,我们的无需训练框架在不同交并比(IoU)阈值下的准确率上,相比基线模型显示出5%到30%的性能提升。
引用
@article{arxiv.2602.08211,
title = {Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension},
author = {Yik Lung Pang and Changjae Oh},
journal= {arXiv preprint arXiv:2602.08211},
year = {2026}
}
备注
4 pages, 5 figures, 2 tables