OCC-MLLM-CoT-Alpha: 基于3D感知监督和链式思维指导的大规模多模态遮挡识别
计算机视觉与模式识别
2025-04-08 v1
摘要
在现有的大规模视觉语言多模态模型中,遮挡目标的理解研究不足。当前领先的多模态大模型在通过通用视觉编码器和监督学习策略理解遮挡目标方面表现不佳。因此,我们提出OCC-MLLM-CoT-Alpha,一种集成3D感知监督和链式思维指导的多模态大型视觉语言框架。具体而言,(1)我们构建了一个由大型多模态视觉语言模型和3D重建专家模型组成的多模态大型视觉语言模型框架。(2)通过监督学习和强化学习策略的结合,学习相应的多模态链式思维,使多模态视觉语言模型能够通过所学的多模态链式思维指导来增强识别能力。(3)构建了一个由个遮挡目标样本组成的大规模多模态链式思维推理数据集。在评估方面,所提方法在多种领先模型的不同设置下,分别实现了15.75%、15.30%、16.98%、14.62%以及4.42%、3.63%、6.94%、10.70%的决策得分提升。
引用
@article{arxiv.2504.04781,
title = {OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance},
author = {Chaoyi Wang and Baoqing Li and Xinhan Di},
journal= {arXiv preprint arXiv:2504.04781},
year = {2025}
}
备注
This work has been accepted to the Multimodal Algorithmic Reasoning (MAR) Workshop at CVPR 2025