RT-VLM:基于 4 线索重新思考视觉语言模型以提升现实世界目标识别鲁棒性
计算机视觉与模式识别
2025-09-09 v1 人工智能
摘要
现代目标识别模型在实际部署中常暴露于导致准确率严重下降的领域迁移中。这些迁移包括(i)低层图像统计的变化、(ii)物体姿态和视点的变化、(iii)部分遮挡,以及(iv)相邻类别之间的视觉混淆。为缓解这种退化,本文引入了重新思考视觉语言模型(RT-VLM)框架。该框架的基础是一种独特的合成数据集生成管道,产生标注有“4 线索”的图像:精确的边界框、类别名称、详细的对象级说明以及整个场景的综合性说明。随后对 Llama 3.2 11B Vision Instruct 在此资源上进行参数高效的监督式调优。在推理时,执行两阶段重新思考方案:模型首先输出自身的四条线索,然后重新审视这些响应作为证据并迭代纠正。在隔离单个领域迁移的鲁棒基准测试中,RT-VLM 持续超过强大基线。这些发现表明,结构化多模态证据与显式自我批判循环的集成构成了通向可靠和可迁移视觉理解的有前景之路。
引用
@article{arxiv.2509.05333,
title = {RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness},
author = {Junghyun Park and Tuan Anh Nguyen and Dugki Min},
journal= {arXiv preprint arXiv:2509.05333},
year = {2025}
}